REKLAMA

Powstała nowa rodzina polskich modeli językowych do wyszukiwania informacji

2026-07-19 18:00
publikacja
2026-07-19 18:00
Dodaj Bankier.pl w Google

Działający w ramach Ośrodka Przetwarzania Informacji (OPI) AI Lab opracował nową rodzinę modeli językowych PolDense przeznaczonych do wyszukiwania informacji. Jak informuje placówka, w publicznym rankingu PIRB model Poldense zajmuje pierwsze miejsce pod względem skuteczności działania.

Powstała nowa rodzina polskich modeli językowych do wyszukiwania informacji
Powstała nowa rodzina polskich modeli językowych do wyszukiwania informacji
fot. Coffeemill / / Shutterstock

Modele PolDense powstały w celu pracy na systemach pracujących z dużymi wolumenami danych nieustrukturyzowanych, w szczególności w wyszukiwarkach, chatbotach, asystentach AI oraz aplikacjach wykorzystujących popularną obecnie architekturę RAG (Retrieval Augmented Generation).

– Udostępnienie modeli PolDense to kolejny krok w budowaniu polskich kompetencji w obszarze sztucznej inteligencji. Tworzymy otwarte technologie, które mogą być wykorzystywane przez naukowców, administrację publiczną i przedsiębiorców do budowy nowoczesnych, efektywnych i bezpiecznych narzędzi AI. Warto podkreślić, że jeden z nowych modeli OPI jest na pierwszym miejscu wg Polish Information Retrieval Benchmark (PIRB), wyprzedzając wielojęzyczne modele typu llama czy bge – podkreśla dr hab. inż. Jarosław Protasiewicz, dyrektor Ośrodka Przetwarzania Informacji - Państwowego Instytutu Badawczego.

Rodzina PolDense obejmuje sześć modeli opartych na architekturze ModernBERT i technologii ettin-encoders. Modele posiadają od 17 milionów do 1 miliarda parametrów, co pozwala dobrać rozwiązanie zarówno do wdrożeń wymagających najwyższej jakości, jak i do środowisk o ograniczonych zasobach sprzętowych. Modele potrafią analizować teksty o długości nawet 8192 tokenów, dzięki czemu lepiej zachowują kontekst długich dokumentów oraz skuteczniej identyfikują najbardziej trafne informacje.

Największy model z rodziny – PolDense 1B – osiągnął wynik 64,11 punktu w benchmarku PIRB, wyprzedzając znacznie większe modele wielojęzyczne, takie jak Llama-Embed-Nemotron-8B (63,73) oraz BGE-Multilingual-Gemma2-9B (63,26).

Modele o wielkości 400 mln i 150 mln parametrów oferują bardzo konkurencyjne wyniki względem rozwiązań posiadających kilka miliardów parametrów, natomiast najmniejsze warianty – 68 mln, 32 mln i 17 mln parametrów – zostały zaprojektowane z myślą o wdrożeniach na procesorach CPU, urządzeniach mobilnych oraz środowiskach edge computing.

Wakacje na giełdzie

Modele PolDense zostały udostępnione przez Ośrodek Przetwarzania Informacji jako rozwiązania open source. Dzięki temu mogą być wykorzystywane do budowy własnych mechanizmów wyszukiwania, systemów RAG i narzędzi wspierających pracę z bazami dokumentów. Zastosowanie modeli PolDense pozwala nie tylko poprawić jakość wyszukiwania informacji, lecz także obniżyć koszty wdrożeń poprzez wykorzystanie mniejszych i bardziej efektywnych obliczeniowo modeli bez utraty wysokiej skuteczności działania.

Dr inż. Marek Kozłowski, kierownik AI Lab w Ośrodku Przetwarzania Informacji, podkreśla znaczenie modeli opracowanych w OPI dla różnego rodzaju użytkowników.

– PolDense pokazuje, że można tworzyć modele wyspecjalizowane dla języka polskiego, które nie tylko konkurują z największymi rozwiązaniami światowymi, ale w wielu specyficznych zadaniach osiągają od nich lepsze wyniki. Naszym celem było opracowanie rodziny modeli odpowiadającej na potrzeby bardzo różnych zastosowań – od dużych systemów korporacyjnych, po lekkie wdrożenia działające lokalnie. Wszystkie modele udostępniamy za darmo na platformie Hugging Face, aby wspierać rozwój polskiego ekosystemu AI – podsumowuje Kozłowski.

W kolejnych miesiącach AI Lab OPI planuje udostępnienie modelu EuroDense, który wspiera wyszukiwanie informacji w dziewięciu językach europejskich.

Modele PolDense zostały opracowane w ramach projektu Large Language Models for the European Union (LLMs4EU) realizowanego przez konsorcjum Alliance for Language Technologies – ALT-EDIC. Celem projektu jest rozwój i udostępnianie modeli, narzędzi oraz usług opartych na sztucznej inteligencji dla pięciu kluczowych sektorów: nauki, usług publicznych, turystyki, telekomunikacji oraz energetyki. Projekt ma zachęcać do wykorzystywania europejskich technologii AI przez instytucje publiczne oraz małe i średnie przedsiębiorstwa. LLMs4EU jest współfinansowany ze środków UE w ramach programu Digital Europe Programme oraz Ministerstwa Cyfryzacji. Modele PolDense dostępne są za darmo na platformie Hugging Face. (PAP)

masz/ bar/

Źródło:PAP
Tematy

Komentarze (1)

dodaj komentarz
f_kruggeri
Zgodnie z najnowszymi danymi agregowanymi przez platformy Arena AI oraz BenchLM.ai, czołówka systemów LLM prezentuje się następująco:
1 - Claude Mythos 5 / Fable 5 - Anthropic - Absolutny lider w złożonym rozumowaniu, logice i pisaniu kodu.
2 - GPT-5.6 Sol - OpenAI - Najlepsza skuteczność w testach matematycznych (konkursowych)
Zgodnie z najnowszymi danymi agregowanymi przez platformy Arena AI oraz BenchLM.ai, czołówka systemów LLM prezentuje się następująco:
1 - Claude Mythos 5 / Fable 5 - Anthropic - Absolutny lider w złożonym rozumowaniu, logice i pisaniu kodu.
2 - GPT-5.6 Sol - OpenAI - Najlepsza skuteczność w testach matematycznych (konkursowych) i wieloetapowej analizie.
3 - Kimi-K3 - Moonshot AI - Chiński model komercyjny o potężnych możliwościach analitycznych.
4 - Claude Opus 4.8 / 4.7 - Anthropic - Najlepszy stosunek najwyższej jakości do optymalizacji kosztów API.
5 - Gemini 3.1 Pro - Google - Gigantyczne okno kontekstowe (analiza potężnych baz danych) i multimodalność.
Na pocieszenie - najnowsze badania amerykańskich uniwersytetów i Microsoftu wykazały, że język polski jest jednym z najefektywniejszych narzędzi do komunikacji ze współczesnymi modelami ze względu na swoją strukturę gramatyczną (osiąga aż 88% skuteczności w złożonym promptowaniu) - https://www.benchmark.pl/jezyk-polski-ai-badania-7268594204643905a.
Na polskim rynku komercyjnym w testach najlepiej wypadają amerykańscy giganci (Claude i GPT) (https://www.aiobserwator.pl/modele-llm-a-jezyk-polski-test-wykazal-ktore-radza-sobie-najlepiej/), natomiast w segmencie rozwiązań lokalnych i narodowych najwyższe noty zbiera najnowszy Bielik 3.0.
Polecam też lekturę raportu https://jelesnianski.pl/badania-llm/

Powiązane: Sztuczna inteligencja

Polecane

Najnowsze

Popularne

Ważne linki