Strona główna Biznes i gospodarka Polska rozwija własne modele AI do wyszukiwania informacji. Mają wspierać rozwój systemów...

Polska rozwija własne modele AI do wyszukiwania informacji. Mają wspierać rozwój systemów agentowych

0
1

Nowe polskie modele AI mogą zwiększyć niezależność technologiczną krajowych podmiotów w obszarze wyszukiwania informacji. Rodzina modeli PolDense, opracowana przez AI Lab w Ośrodku Przetwarzania Informacji, jest przeznaczona do pracy z językiem polskim. Według twórców niektóre z tych modeli osiągają w tej pracy lepsze wyniki niż większe modele wielojęzyczne i mogą działać przy znacznie mniejszych wymaganiach sprzętowych.

Rodzina PolDense, przeznaczona dla języka polskiego, obejmuje sześć modeli opartych na architekturze ModernBERT i technologii ettin-encoders. Mają one od 17 mln do 1 mld parametrów. Zostały opracowane z myślą o systemach pracujących z dużymi wolumenami danych nieustrukturyzowanych, w szczególności w wyszukiwarkach, chatbotach, asystentach AI oraz aplikacjach wykorzystujących architekturę RAG (Retrieval Augmented Generation). Potrafią analizować teksty o długości nawet 8192 tokenów.

Są to specjalistyczne modele językowe, których celem jest wsparcie wyszukiwania informacji. Trzeba być świadomym, że nie są one porównywalne z modelami typu ChatGPT, Claude czy chińskie Qwen i DeepSeek, ponieważ nie są to modele generatywne – mówi agencji Newseria dr inż. Marek Kozłowski, kierownik AI Lab w OPI-PIB. – Modele wyszukiwania informacji są bardzo ważne. To przede wszystkim wsparcie rewolucji agentowej, która obecnie następuje i która będzie oparta na wykorzystaniu własnych zbiorów danych. Żeby duże modele językowe przetwarzały właściwe dane, należy je wyszukać, i po to właśnie są modele PolDense – aby skutecznie wyszukiwać informacje w naszych lokalnych zbiorach danych i potem przekazywać je do dużych modeli językowych.

Jak wskazują twórcy PolDense, coraz więcej rozwiązań wykorzystujących duże modele językowe opiera się na podejściu RAG, które pozwala generować odpowiedzi nie tylko na podstawie wiedzy zapisanej w modelu, lecz przede wszystkim na podstawie aktualnych i wyszukanych w czasie rzeczywistym dokumentów typowych dla danej branży. Skuteczność takich systemów zależy w dużym stopniu od jakości mechanizmu wyszukiwania informacji. Jednym z podejść pozwalających zwiększyć skuteczność wyszukiwania są tzw. dense retrievery, czyli modele oparte na głębokich sieciach neuronowych. Potrafią one przekształcać pytania i dokumenty w kompaktowe reprezentacje wektorowe, umożliwiające precyzyjne wyszukiwanie treści na podstawie znaczenia, a nie wyłącznie dopasowania słów kluczowych. Właśnie nad tego typu technologiami wyszukiwania informacji pracuje obecnie AI Lab OPI.

  Naprawa pieców gazowych we Wrocławiu

– Już teraz widać, jak duże jest zapotrzebowanie na rozwiązania typu RAG. Wierzymy w to, że wraz z rewolucją agentową, która nadejdzie w ciągu najbliższych dwóch–trzech lat, a na Zachodzie już nadchodzi, potrzeba wyszukiwania jak najbardziej wartościowej informacji lokalnej i przekazywanie jej do kolejnych agentów będzie elementem kluczowym dla sukcesu wdrożeń w przemyśle i organach publicznych. Zapotrzebowanie to widać już choćby po liczbie pobrań tych modeli na Hugging Face – mówi dr inż. Marek Kozłowski.

Modele PolDense zostały udostępnione przez OPI-PIB jako open source na platformie Hugging Face. Mogą być wykorzystywane przez naukowców, administrację publiczną i przedsiębiorców do tworzenia własnych mechanizmów wyszukiwania, systemów RAG oraz narzędzi do pracy z bazami dokumentów.

Często wdrożenia, które dotąd polegały na wyszukaniu informacji, opierały się na modelach chińskich lub amerykańskich. Teraz możemy wziąć model polski, który jest lepszy, skuteczniejszy od modeli zagranicznych i do tego jest dziesięciokrotnie mniejszy. Dzięki temu, że ta rodzina modeli jest tak szeroka, to niektóre z nich możemy uruchomić nawet na infrastrukturze bez GPU, czyli najtańszej, na zwykłych procesorach obliczeniowych. Możemy dobrać model w zależności od tego, jakie mamy potrzeby, i infrastrukturę lokalną – podkreśla kierownik AI Lab w OPI-PIB.

Największy z modeli, PolDense 1B, uzyskał 64,11 pkt w benchmarku Polish Information Retrieval Benchmark (PIRB), zajmując pierwsze miejsce w rankingu. Wyprzedził m.in. modele wielojęzyczne mające kilka razy więcej parametrów.

– Modele PolDense są porównywalne lub lepsze od modeli wielojęzycznych koncernów zagranicznych, które są 10 razy większe. To jest bardzo ważna informacja, dlatego że jeśli mamy model dziesięciokrotnie mniejszy od modeli międzynarodowych, to jest dziesięciokrotnie tańszy w utrzymaniu, zajmuje mniej pamięci i jest szybszy na naszej infrastrukturze. Daje nam więc dwojakie zyski: wyższą lub porównywalną skuteczność i do tego jeszcze wielokrotnie niższe koszty utrzymania, dodatkowo niezależność technologiczną i suwerenność, która jest kwestią najtrudniej wycenialną – mówi dr inż. Marek Kozłowski. 

  Na rynku działa już ponad 1,2 mln terminali płatniczych. Nadal może być 500–600 tys. miejsc, gdzie płatności bezgotówkowe nie są przyjmowane

Polska pozostaje wyraźnie poniżej unijnej średniej pod względem wykorzystania sztucznej inteligencji przez przedsiębiorstwa. Według Eurostatu w 2025 roku AI wykorzystywało 8,4 proc. polskich firm, wobec 20 proc. w całej Unii Europejskiej. Ubiegłoroczne badanie PwC „Polskie firmy nie wykorzystują w pełni potencjału AI” pokazuje rosnące zainteresowanie agentami AI wśród dużych przedsiębiorstw. Wśród badanych 187 firm zatrudniających co najmniej 250 pracowników, z 17 branż, 44 proc. korzystało z agentów AI, a kolejne 14 proc. planowało ich wdrożenie. 

Źródło: https://biznes.newseria.pl/news/polska-rozwija-wlasne,p1799170744