REKLAMA

Polska AI przegrała z gigantami. Bielik i PLLuM wypadły słabo w testach

2026-03-17 07:00
publikacja
2026-03-17 07:00
Dodaj Bankier.pl w Google

W pierwszym „polskim” teście dużych modeli językowych krajowe systemy AI, Bielik i PLLuM wypadły znacznie gorzej od globalnych narzędzi - pisze wtorkowa „Rzeczpospolita”.

Polska AI przegrała z gigantami. Bielik i PLLuM wypadły słabo w testach
Polska AI przegrała z gigantami. Bielik i PLLuM wypadły słabo w testach
fot. Coffeemill / / Shutterstock

„Test obejmował 20 zadań z 10 kategorii, od tworzenia maila, przez porady dla firm, sprawdzanie poprawności językowej, po znajomość polskiej historii i kultury (np. przytoczenie pierwszych 12 wersów „Pana Tadeusza”). Wyniki testu przeprowadzonego przez firmę Oxido, okazały się zaskakujące” - relacjonuje gazeta.

Spośród 12 modeli wygrało narzędzie Google’a. Na podium znalazł się także chiński model Qwen oraz model Llama od Mety (właściciela m. in. Facebooka – PAP). „Polskie modele uplasowały się natomiast na szarym końcu” - podkreśla dziennik.

„Wynik jest tym bardziej zaskakujący, że dotychczas eksperci przekonywali, iż polskie modele lepiej znają niuanse naszego języka i historii. „Polskie modele zawiodły tymczasem w kategoriach, które teoretycznie powinny być ich przewagą. Na przykład przy inwokacji «Pana Tadeusza»­ Bielik był ósmy, a PLLuM – trzeci od końca" - pisze „Rz".

Zdaniem Marka Jeleśniańskiego, autora badania, pozycja Bielika przy ograniczonych zasobach twórców to jednak „niezły wynik”, a polskie modele mogą stać się alternatywą przy dalszych inwestycjach. „Gdyby stworzyć sensowne ramy dla dotacji i innowacji, gdyby zainteresować inwestorów i instytucje aktywniejszym finansowaniem rozwoju Mistrala czy polskich modeli, to moglibyśmy zmniejszyć dystans, jaki nas dzieli do konkurentów” - przekonuje Jeleśniański. (PAP)

bal/ sp/

Wakacje na giełdzie
Źródło:PAP
Tematy

Komentarze (13)

dodaj komentarz
spokojowo
Myślę że nie tylko w tworzeniu modeli, ale też na polu serwerowni, w innych krajach ogranicza się moc przeznaczoną na AI bo mają tdużo DATA CENTER dla AI a my nie mamy ani jednego (lub pojedyncze). Nawet gdybyśmy chcieli nadgonić to nie mamy czym tego zasilić, koniunktura jest przespana bo ceny sprzętu Myślę że nie tylko w tworzeniu modeli, ale też na polu serwerowni, w innych krajach ogranicza się moc przeznaczoną na AI bo mają tdużo DATA CENTER dla AI a my nie mamy ani jednego (lub pojedyncze). Nawet gdybyśmy chcieli nadgonić to nie mamy czym tego zasilić, koniunktura jest przespana bo ceny sprzętu wystrzeliły.
incitatus
Bielik wśród modeli AI to taka Izera wśród samochodów elektrycznych.
moravietz
Nie wyglupiaj sie, Bielik przynajmniej powstal xD
I szczerze -zycze im zeby sie rozwineli, ja tu pietniuje raczej nasze "podejscie": Ktos mial fajny pomysl, wykonal POC, pokazal POC, zaraz zjawily sie media i poliutycy zaczeli sobie selfie robic, pare flashy przed kamerami i stwierdzenie: "polska gurom". Gratulacje,
Nie wyglupiaj sie, Bielik przynajmniej powstal xD
I szczerze -zycze im zeby sie rozwineli, ja tu pietniuje raczej nasze "podejscie": Ktos mial fajny pomysl, wykonal POC, pokazal POC, zaraz zjawily sie media i poliutycy zaczeli sobie selfie robic, pare flashy przed kamerami i stwierdzenie: "polska gurom". Gratulacje, jestescie dzielni! Macie nasze moralne wsparcie, w koncu to sukces naszej ekipy politycznej! Nara -wracamy dalej trwonic pieniadze podatnika.

A wystarczyloby wsparcie, dofinansowanie z glowa. Bieda klaster za kilka marnych baniek dalby rade zapewne podtuningowac chinski wariant na polską modłę.
moravietz
Stworzylismy Proof Of Concept i zamiast doinwestowac na miare 40mln panstwa spoczelismy na samozachwycie. A ze QWEN wymiata to nie tajemnica. Wlasciwie nic onpremowego nie rowna sie osiagnieciom koncernu Alibaby. Jedyne do czego mozna sie przyczepic, to, ze QWEN potrafi czasem wymyslac nowe polskie wyrazy lub przekrecac koncowki.Stworzylismy Proof Of Concept i zamiast doinwestowac na miare 40mln panstwa spoczelismy na samozachwycie. A ze QWEN wymiata to nie tajemnica. Wlasciwie nic onpremowego nie rowna sie osiagnieciom koncernu Alibaby. Jedyne do czego mozna sie przyczepic, to, ze QWEN potrafi czasem wymyslac nowe polskie wyrazy lub przekrecac koncowki. ALe prawdopodobnie dotyczy to modeli nisko skwantyzowanych
moravietz
Wlasciwie banalnie prosty pomysl mam na Bielika 3.0: Wez najwiekszy dostepny QWEN 3.5 instruct i wyszkol na nim polskie realia. Efekt bedzie lepszy, gwarantuje. Tylko pewnie trzebaby wydac pare baniek na konkretny klaster H200
derper
Inwokacja to nie "niuans naszego języka i historii", a przytoczenie 200 tokenów nie jest celem pierwotnym takiego modelu, więc 50% kategorii "polska kultura" leży - bo jak się okazuje w każdej z 10 kategorii były aż 2 zadania, więc wyciągnięcie średniej ocen jest tak szybkie jak pozbawione sensu.
marian4321
Próbowałem skorzystać z Bielika. Zadalem proste pytania dot. finansów, medycyny, prawa i Pana Tadeusza. Zamiast odpowiedzi zostalem odsyłany do doradcy finansowego, lekarza i prawnika. Odnoście Pana Tadeusza, Bielik odpisał, że on nie pomaga w pisaniu wypracowań. Na te same pytania popularne zagraniczne modele odpowiadały bez problemu Próbowałem skorzystać z Bielika. Zadalem proste pytania dot. finansów, medycyny, prawa i Pana Tadeusza. Zamiast odpowiedzi zostalem odsyłany do doradcy finansowego, lekarza i prawnika. Odnoście Pana Tadeusza, Bielik odpisał, że on nie pomaga w pisaniu wypracowań. Na te same pytania popularne zagraniczne modele odpowiadały bez problemu i do nikogo nie odsyłaly. Tak więc Bielik to wielki kit, być może nie jest to zaden LLM.
moravietz
Bielik jest drewniany, jakby polknal kij od szczotki. Jego zdolnosci kompetencyjnych nie ocenialem, ale skladnosc, ekspresyjnosc i bogactwo wypowiedzi przypominaja introwertyka z aspergerem. Zakladam rowniez, ze nie umie uruchamiac narzedzi.
samsza
Główne założenia takiego testu to:
Dokończenie frazy: Sprawdzenie, czy model po wpisaniu słów „Litwo! Ojczyzno moja!” potrafi bezbłędnie kontynuować tekst, zachowując archaiczną składnię i interpunkcję.
Rozumienie kontekstu (Context Window): Weryfikacja, czy model „pamięta” początek długiego fragmentu i nie gubi wątku w trakcie
Główne założenia takiego testu to:
Dokończenie frazy: Sprawdzenie, czy model po wpisaniu słów „Litwo! Ojczyzno moja!” potrafi bezbłędnie kontynuować tekst, zachowując archaiczną składnię i interpunkcję.
Rozumienie kontekstu (Context Window): Weryfikacja, czy model „pamięta” początek długiego fragmentu i nie gubi wątku w trakcie generowania dalszych wersów.
Halucynacje: Badanie, czy AI nie zaczyna zmyślać treści lub mieszać Pana Tadeusza z innymi dziełami (np. Konradem Wallenrodem) pod wpływem podobnego stylu.
Tokenizacja: Sprawdzenie, jak model radzi sobie z rzadziej używanymi, staropolskimi wyrazami (np. „gryczana”, „dzięcielina”), które są trudne dla algorytmów trenowanych głównie na języku angielskim.
tomitomi
....bo , my jesteśmy p-o tęgą ! O !!

Powiązane: Sztuczna inteligencja

Polecane

Najnowsze

Popularne

Ważne linki