{"id":34845,"date":"2026-09-22T10:50:29","date_gmt":"2026-09-22T08:50:29","guid":{"rendered":"https:\/\/sii.pl\/blog\/?p=34845"},"modified":"2026-09-22T13:07:20","modified_gmt":"2026-09-22T11:07:20","slug":"nowe-modele-ai-w-praktyce-co-fable-5-1-i-gpt-6-astra-mowia-nam-o-ai-native-delivery","status":"publish","type":"post","link":"https:\/\/sii.pl\/blog\/nowe-modele-ai-w-praktyce-co-fable-5-1-i-gpt-6-astra-mowia-nam-o-ai-native-delivery\/","title":{"rendered":"Nowe modele AI w praktyce: co Fable 5.1 i GPT-6 Astra m\u00f3wi\u0105 nam o AI-native delivery"},"content":{"rendered":"\n<p>Dwa nowe flagowe modele, tydzie\u0144 pierwszych test\u00f3w i sporo szumu wok\u00f3\u0142 ich mo\u017cliwo\u015bci. Pierwsze wyniki ju\u017c m\u00f3wi\u0105 co\u015b u\u017cytecznego o tym, jak ocenia\u0107 modele frontier pod k\u0105tem realnego delivery.<\/p>\n\n\n\n<p>W ci\u0105gu trzech dni <strong>na pocz\u0105tku wrze\u015bnia<\/strong> pojawi\u0142y si\u0119 dwa nowe modele czo\u0142owych dostawc\u00f3w: <strong>Claude Fable 5.1 i GPT-6 Astra<\/strong>, odpowiednio od Anthropic i OpenAI. <strong>Przez tydzie\u0144 analizowali\u015bmy dost\u0119pne publikacje oraz wyniki obu modeli.<\/strong><\/p>\n\n\n\n<p>Jak mo\u017cna si\u0119 spodziewa\u0107, na werdykt produkcyjny jest zdecydowanie za wcze\u015bnie. Nie ma jeszcze znacz\u0105cych wdro\u017ce\u0144 produkcyjnych, opublikowanych liczb ROI, historii spektakularnych pora\u017cek ani postmortem\u00f3w po rollbackach.<\/p>\n\n\n\n<p>Wi\u0119kszo\u015b\u0107 dost\u0119pnych dzi\u015b danych pochodzi z test\u00f3w publikowanych przez dostawc\u00f3w, niezale\u017cnych ewaluacji i wczesnych eksperyment\u00f3w, co sprawia, \u017ce ka\u017cdy definitywny ranking jest przedwczesny. Jednocze\u015bnie przydatno\u015b\u0107 pierwszego tygodnia polega na tym, \u017ce pozwala pozyska\u0107 szersz\u0105 perspektyw\u0119 na temat tego, jak du\u017ca cz\u0119\u015b\u0107 wydajno\u015bci, kt\u00f3r\u0105 przypisujemy modelowi, w rzeczywisto\u015bci pochodzi z systemu zbudowanego wok\u00f3\u0142 niego.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Specyfikacja modeli i pocz\u0105tkowe r\u00f3\u017cnice<\/strong><\/h2>\n\n\n\n<p>Zanim w og\u00f3le zbli\u017cymy si\u0119 do jakiegokolwiek benchmarku, zbudujmy intuicj\u0119. Oto podstawowe por\u00f3wnanie.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><tbody><tr><td class=\"has-text-align-center\" data-align=\"center\"><strong>Specyfikacja<\/strong><\/td><td class=\"has-text-align-center\" data-align=\"center\"><strong>GPT-6 Astra<\/strong><\/td><td class=\"has-text-align-center\" data-align=\"center\"><strong>Claude Fable 5.1<\/strong><\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Kontekst<\/td><td class=\"has-text-align-center\" data-align=\"center\">~1M<\/td><td class=\"has-text-align-center\" data-align=\"center\">~1M<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Data odci\u0119cia wiedzy<\/td><td class=\"has-text-align-center\" data-align=\"center\">30 kwietnia 2026<\/td><td class=\"has-text-align-center\" data-align=\"center\">czerwiec 2026<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Cena API\/1M token\u00f3w<\/td><td class=\"has-text-align-center\" data-align=\"center\">10 USD \/ 50 USD<\/td><td class=\"has-text-align-center\" data-align=\"center\">10 USD \/ 50 USD<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Odczyt z cache&#8217;u\/1M token\u00f3w<\/td><td class=\"has-text-align-center\" data-align=\"center\">1,00 USD<\/td><td class=\"has-text-align-center\" data-align=\"center\">0,25 USD<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p>Oba modele s\u0105 wielomodalne (operuj\u0105 na tre\u015bciach tekstowych, graficznych, audio itd.), cho\u0107 \u017caden nie generuje natywnie wideo, audio ani obraz\u00f3w, zazwyczaj u\u017cywaj\u0105c do tego zewn\u0119trznych narz\u0119dzi.<\/p>\n\n\n\n<p>Specyfikacja zarysowuje bardzo zgrubnie granice u\u017cyteczno\u015bci, m\u00f3wi jednak znacznie mniej o tym, co si\u0119 stanie, gdy model stanie si\u0119 cz\u0119\u015bci\u0105 prawdziwego workflow delivery, z prawdziwym kontekstem, prawdziwymi narz\u0119dziami i prawdziwymi lud\u017ami wok\u00f3\u0142.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Benchmarki coraz cz\u0119\u015bciej mierz\u0105 ca\u0142e systemy<\/strong><\/h2>\n\n\n\n<p>3 wrze\u015bnia <a href=\"https:\/\/artificialanalysis.ai\/models\/gpt-6-astra\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Artificial Analysis notowa\u0142 Fable 5.1 na poziomie 66 punkt\u00f3w procentowych w swoim Intelligence Index<\/a>, najwy\u017cszy wynik w historii tego indeksu, przy 61 dla Astry.<\/p>\n\n\n\n<p>8 wrze\u015bnia, <a href=\"https:\/\/artificialanalysis.ai\/models\/releases\/gpt-6-astra\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >ju\u017c w wersji indeksu v4.3, oba modele mia\u0142y po 53<\/a>.<\/p>\n\n\n\n<p>Modele nie uleg\u0142y zmianie, a zatem zmieni\u0142a si\u0119 metodologia oceny. Efekt staje si\u0119 jeszcze wyra\u017aniejszy, gdy spojrzymy na systemy otaczaj\u0105ce model.<\/p>\n\n\n\n<p>Jeden benchmark idzie krok dalej i celowo mierzy pary model\u2013harness, gdzie <em>harness <\/em>to warstwa software&#8217;owa orkiestruj\u0105ca dzia\u0142ania agenta, narz\u0119dzia i zasoby. To jednocze\u015bnie najbli\u017csza produkcyjnym warunkom ewaluacja, jak\u0105 dot\u0105d opublikowano. Real-SWE od Specific Labs uruchamia dziesi\u0119\u0107 zada\u0144 z licencjonowanych, prywatnych repozytori\u00f3w produkcyjnych napisanych przed 2023 rokiem, ka\u017cdy model w swoim natywnym harnessie. Osiem konfiguracji, osiem uruchomie\u0144 na zadanie, 640 rollout\u00f3w \u0142\u0105cznie, raportowanych jako pass@1 z przedzia\u0142ami ufno\u015bci.<\/p>\n\n\n\n<p>\u017badna konfiguracja nie przekroczy\u0142a 40%. Fable 5.1 w Claude Code prowadzi z 38,8%, Astra w Codex CLI osi\u0105ga 33,8%, Gemini 3.8 Flash 31,2%, a pozosta\u0142e pi\u0119\u0107 konfiguracji l\u0105duje mi\u0119dzy 16% a 29%. \u017beby zobrazowa\u0107 z\u0142o\u017cono\u015b\u0107 problem\u00f3w: <strong>sze\u015b\u0107 z dziesi\u0119ciu zada\u0144 jest rozwi\u0105zywanych rzadziej ni\u017c w 15% przypadk\u00f3w, a jedno nie zosta\u0142o rozwi\u0105zane ani razu.<\/strong><\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Zastrze\u017cenia<\/strong><\/h3>\n\n\n\n<p>Wzorzec pora\u017cek to cz\u0119\u015b\u0107, kt\u00f3r\u0105 zabraliby\u015bmy na rozmow\u0119 z klientem, bo najcz\u0119stszym powodem niepowodzenia jest pomijanie wymaga\u0144. W dw\u00f3ch najmocniejszych modelach niezweryfikowane za\u0142o\u017cenia i b\u0142\u0119dy integracyjne pojawiaj\u0105 si\u0119 r\u00f3wnie cz\u0119sto, a Astra cz\u0119\u015bciej wyk\u0142ada si\u0119 na nich ni\u017c na wymaganiach. Mediana liczby poprawianych jednocze\u015bnie plik\u00f3w to jedena\u015bcie, mniej wi\u0119cej dwa razy wi\u0119cej ni\u017c analogiczna mediana w publicznych benchmarkach kodowania.<\/p>\n\n\n\n<p>Prompty s\u0105 przy tym niedookre\u015blone tylko w podobnym stopniu jak w DeepSWE czy Terminal-Bench: m\u00f3wi\u0105, co zmieni\u0107, nie jak, a szczeg\u00f3\u0142y trzeba znale\u017a\u0107 w repozytorium i otaczaj\u0105cych je narz\u0119dziach.<\/p>\n\n\n\n<p>Koszty nie przek\u0142adaj\u0105 si\u0119 liniowo na skuteczno\u015b\u0107: 38,8% Fable 5.1 kosztuje 6,96 USD za rollout wobec 4,67 USD za 33,8% Astry, czyli oko\u0142o 1,5 raza wi\u0119cej za pi\u0119\u0107 punkt\u00f3w, przy czym Fable zu\u017cywa 64 tys. token\u00f3w wyj\u015bciowych na rollout, a Astra 24 tys. Gemini 3.8 Flash jeszcze bardziej sp\u0142aszcza t\u0119 krzyw\u0105: 31,2% za 2,50 USD. Podobnie, czas egzekucji nie wp\u0142ywa jednoznacznie na jako\u015b\u0107 rezultatu \u2013 rollouty poni\u017cej dziesi\u0119ciu minut ko\u0144czy\u0142y si\u0119 pora\u017ck\u0105 prawie tak samo cz\u0119sto jak d\u0142u\u017csze (71,4% vs 73,4%).<\/p>\n\n\n\n<p>To wszystko to realne zastrze\u017cenia. Dziesi\u0119\u0107 zada\u0144 i osiemdziesi\u0105t rollout\u00f3w na model oznacza, \u017ce s\u0105siednie wyniki mieszcz\u0105 si\u0119 nawzajem w swoich przedzia\u0142ach ufno\u015bci, wi\u0119c kolejno\u015b\u0107 nie jest sztywnie ustalona. Wyniki natywnych harness\u00f3w odpowiadaj\u0105 praktyce, ale uniemo\u017cliwiaj\u0105 oddzielenie modelu od harnessu. Dodatkowo, \u017cadnego z tych rezultat\u00f3w nie da si\u0119 tu odtworzy\u0107, bo kod jest prywatny.<\/p>\n\n\n\n<p><a href=\"https:\/\/arcprize.org\/blog\/astra\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >ARC Prize poda\u0142<\/a>, \u017ce Astra osi\u0105gn\u0119\u0142a 62,7% na ARC-AGI-3 w harnessie neutralnym wobec dostawcy, z maksymalnym poziomem rozumowania, 98,6% z u\u017cyciem w\u0142asnego Provider Adaptera OpenAI i, nieintuicyjnie, 99,9% z wysokim poziomem rozumowania w tym drugim \u015brodowisku. R\u00f3\u017cnica le\u017cy w scaffoldingu, nie w wagach: neutralny harness odrzuca rozumowanie modelu mi\u0119dzy akcjami, a adapter OpenAI zachowuje ten stan i sam zarz\u0105dza kontekstem.<\/p>\n\n\n\n<p>Dla kontrastu, <a href=\"https:\/\/developer.nvidia.com\/blog\/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents\/\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >NVIDIA osi\u0105gn\u0119\u0142a 100%<\/a> na publicznym podzbiorze tego samego benchmarku, u\u017cywaj\u0105c architektury agentowej zbudowanej na Opusie 5, kt\u00f3rego go\u0142y baseline wynosi\u0142 oko\u0142o 30%. Sama NVIDIA zaznacza, \u017ce te dwie liczby pochodz\u0105 z r\u00f3\u017cnych ustawie\u0144 rozumowania, system\u00f3w agentowych i zbior\u00f3w ewaluacyjnych, wi\u0119c r\u00f3\u017cnica ilustruje tez\u0119, a nie j\u0105 mierzy.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Interpretacja<\/strong><\/h3>\n\n\n\n<p>Po\u0142\u0105czmy kropki: <strong>te r\u00f3\u017cnice s\u0105 wi\u0119ksze ni\u017c wiele z tych, na podstawie kt\u00f3rych og\u0142asza si\u0119, \u017ce jeden model frontier jest lepszy od drugiego<\/strong>. Zmieniaj\u0105 te\u017c to, co powinni\u015bmy ocenia\u0107. Produkcyjna zdolno\u015b\u0107 AI to co\u015b wi\u0119cej ni\u017c wagi modelu. Kontekst, narz\u0119dzia, orkiestracja, retrieval, agenci, uprawnienia i mechanizmy walidacji mog\u0105 istotnie wp\u0142yn\u0105\u0107 na wynik. I ka\u017cdy z tych element\u00f3w jest projektowany, strojony i przegl\u0105dany przez ludzi, kt\u00f3rzy rozumiej\u0105 zadanie oraz kontekst biznesowy. Ca\u0142y workflow zas\u0142uguje wi\u0119c na tak\u0105 sam\u0105 uwag\u0119 jak model pod spodem.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Gdzie Astra wygl\u0105da dzi\u015b mocniej<\/strong><\/h2>\n\n\n\n<p>Jedn\u0105 z najwyra\u017aniejszych wczesnych <strong>przewag Astry jest computer use: obs\u0142uga oprogramowania bezpo\u015brednio zamiast polegania wy\u0142\u0105cznie na jawnych integracjach.<\/strong><\/p>\n\n\n\n<p>W\u015br\u00f3d bezpo\u015brednio por\u00f3wnywalnych wynik\u00f3w Astra wyprzedza Opusa 5 na OSWorld 2.0 (72,6% vs 70,2%) i bije wynik Mythosa 5 na ScreenSpot-Pro (92,7% vs 87,3%). OpenAI nie publikuje por\u00f3wnywalnego wyniku computer use dla Fable 5.1, a 41,7% od Anthropic zmierzono na innych zadaniach, z innym sposobem oceniania i innymi zabezpieczeniami.<\/p>\n\n\n\n<p>Mo\u017ce to mie\u0107 znaczenie w \u015brodowiskach enterprise z d\u0142ugim ogonem wewn\u0119trznych aplikacji, w kt\u00f3rych dedykowane integracje API trudno uzasadni\u0107.<\/p>\n\n\n\n<p>Agent zdolny do pracy z interfejsem mo\u017ce potencjalnie zautomatyzowa\u0107 cz\u0119\u015b\u0107 tych workflow bezpo\u015brednio. Zamiast usuwa\u0107 wyzwanie in\u017cynierskie, przesuwa jego cz\u0119\u015b\u0107 w inne miejsce. Je\u015bli agent potrafi zalogowa\u0107 si\u0119 do aplikacji, porusza\u0107 si\u0119 po niej i wykonywa\u0107 akcje, musimy zarz\u0105dza\u0107 to\u017csamo\u015bci\u0105, uprawnieniami i sekretami. Jego dzia\u0142ania musz\u0105 by\u0107 audytowalne. Sesje potrzebuj\u0105 mechanizm\u00f3w odzyskiwania. Zmiany w UI potrzebuj\u0105 fallback\u00f3w. Decyzje wysokiego ryzyka wci\u0105\u017c nale\u017c\u0105 do cz\u0142owieka. Computer use mo\u017ce zmniejszy\u0107 nak\u0142ad na integracje, a jednocze\u015bnie zwi\u0119kszy\u0107 wag\u0119 governance i observability.<\/p>\n\n\n\n<p>Jest tu te\u017c aspekt testowy, kt\u00f3ry \u0142atwo \u017ale odczyta\u0107. Agent steruj\u0105cy UI mo\u017ce s\u0142u\u017cy\u0107 jako narz\u0119dzie testowe, ale jego w\u0142asne zachowanie te\u017c wymaga weryfikacji: mo\u017ce zg\u0142osi\u0107 b\u0142\u0105d, bo si\u0119 zgubi\u0142, albo zg\u0142osi\u0107 sukces, przeoczywszy defekt. OSWorld mierzy wykonanie zadania, nie wykrywanie defekt\u00f3w, wi\u0119c te wyniki nic nie m\u00f3wi\u0105 o tym, jak dobrze kt\u00f3rykolwiek z modeli testowa\u0142by aplikacj\u0119. To trzeba zmierzy\u0107 osobno, na reprezentatywnych workflow ze znanymi defektami, licz\u0105c przeoczone problemy, fa\u0142szywe alarmy i nak\u0142ad pracy na przegl\u0105d tego, co agent znalaz\u0142. Kryteria akceptacji i decyzje o wydaniu pozostaj\u0105 po stronie zespo\u0142u produktowego.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Wyniki<\/strong><\/h3>\n\n\n\n<p>Astra pokazuje te\u017c obiecuj\u0105ce wczesne wyniki w in\u017cynierii oprogramowania. <a href=\"https:\/\/www.coderabbit.ai\/blog\/gpt-6-astra-code-review-evaluation\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >CodeRabbit wykry\u0142 oko\u0142o 4% wi\u0119cej b\u0142\u0119d\u00f3w w code review<\/a> ni\u017c Sol i 22% wi\u0119cej ni\u017c Opus 5, a przy z\u0142o\u017conych przegl\u0105dach obejmuj\u0105cych wiele plik\u00f3w odpowiednio 20% i 33%. Sami autorzy opisuj\u0105 te wyniki jako wczesne i kierunkowe, co doceniamy.<\/p>\n\n\n\n<p>Poprawi\u0142o si\u0119 r\u00f3wnie\u017c rozumowanie wizualne i przestrzenne. <a href=\"https:\/\/decrypt.co\/377514\/openai-gpt-6-astra-review-shockingly-good\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >W te\u015bcie Decrypt Astra wygenerowa\u0142a grywaln\u0105 wersj\u0119 Hangzhou w Three.js w 24 minuty<\/a>. To u\u017cyteczne obserwacje. Dowody z produkcji powiedz\u0105 nam, jak konsekwentnie przek\u0142adaj\u0105 si\u0119 na realne obci\u0105\u017cenia.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Wydajno\u015b\u0107 i cena opowiadaj\u0105 r\u00f3\u017cne historie<\/strong><\/h2>\n\n\n\n<p>Astra pokazuje te\u017c, dlaczego sama cena API jest s\u0142ab\u0105 miar\u0105 ekonomii AI. W <a href=\"https:\/\/x.com\/nateherk\/article\/2096669523956920530\" rel=\"nofollow\" >100-godzinnym te\u015bcie<\/a> Nate&#8217;a Herka Fable uko\u0144czy\u0142 zadanie w 9 h 35 min, Astra w 11 h 19 min. Astra by\u0142a wolniejsza, ale ca\u0142kowity koszt poszed\u0142 w drug\u0105 stron\u0119: 327 USD za Astr\u0119 wobec 513 USD za Fable. Dla tego konkretnego eksperymentu Fable zapewni\u0142 kr\u00f3tszy czas uko\u0144czenia, za\u015b Astra ni\u017cszy rachunek. Alternatywna pula wyzwa\u0144, inny rozmiar kontekstu, wzorzec cache&#8217;owania czy ustawienie rozumowania mog\u0142yby zmieni\u0107 t\u0119 relacj\u0119.<\/p>\n\n\n\n<p>Dla zespo\u0142\u00f3w delivery koszt na uko\u0144czone zadanie jest wi\u0119c bardziej u\u017cyteczn\u0105 metryk\u0105 ni\u017c cena tokena w oderwaniu od kontekstu. Czas uko\u0144czenia, jako\u015b\u0107 i odsetek pora\u017cek nale\u017c\u0105 do tego samego rachunku. <strong>Pytanie brzmi ju\u017c nie \u201ekt\u00f3ry model ma lepszy cennik\u201d, ale \u201ejak ca\u0142y setup zmienia koszt, tempo, jako\u015b\u0107 i przewidywalno\u015b\u0107 delivery\u201d.<\/strong><\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Gdzie Fable 5.1 wygl\u0105da dzi\u015b mocniej<\/strong><\/h2>\n\n\n\n<p>Pisanie tekst\u00f3w to jeden z bardziej sp\u00f3jnych pozytywnych sygna\u0142\u00f3w wok\u00f3\u0142 Fable 5.1. Kilku niezale\u017cnych recenzent\u00f3w zg\u0142asza bardziej naturaln\u0105 proz\u0119 i mniej charakterystycznych dla Claude&#8217;a manier pisarskich. <a href=\"https:\/\/every.to\/vibe-check\/fable-5-1-vibe-check\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Every oceni\u0142 czytelno\u015b\u0107 tekstu mniej wi\u0119cej na poziomie si\u00f3dmej klasy<\/a>, a <a href=\"https:\/\/www.latent.space\/p\/ainews-claude-fablemythos-51-new\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Latent Space opisa\u0142 go jako bli\u017cszy zwyk\u0142ej ludzkiej komunikacji<\/a>.<\/p>\n\n\n\n<p><a href=\"https:\/\/simonwillison.net\/2026\/Sep\/1\/claude-fable-5-1\/\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" ><em>D\u0142ugoletni test SVG Simona Willisona<\/em><\/a> przyni\u00f3s\u0142 rezultat, kt\u00f3ry sam autor uzna\u0142 za najlepszy spo\u015br\u00f3d dotychczasowych modeli Anthropic. Willison od kilku generacji regularnie zleca kolejnym modelom to samo zadanie: <strong>wygenerowanie w formacie SVG obrazu pelikana jad\u0105cego na rowerze<\/strong>. Cho\u0107 jest to test nieformalny, jego warto\u015b\u0107 polega na konsekwentnym stosowaniu tego samego zadania, co pozwala obserwowa\u0107, jak mo\u017cliwo\u015bci modeli zmieniaj\u0105 si\u0119 z generacji na generacj\u0119.<\/p>\n\n\n\n<p>Drugi ciekawy obszar to d\u0142ugotrwa\u0142a samodzielna praca. <a href=\"https:\/\/www.anthropic.com\/claude-fable-and-mythos-5-1\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Ramp opublikowa\u0142 nienadzorowany, 38-godzinny, autonomiczny eksperyment z uczeniem maszynowym<\/a>, w ramach kt\u00f3rego uko\u0144czono wiele eksperyment\u00f3w. Anthropic raportuje te\u017c popraw\u0119 przejrzysto\u015bci, gdy model napotyka problemy, w tym wi\u0119ksz\u0105 sk\u0142onno\u015b\u0107 do sygnalizowania, \u017ce utkn\u0105\u0142, zamiast przedstawiania zadania jako wykonanego. Je\u015bli to si\u0119 utrzyma poza tygodniem premiery, dla pracy bez nadzoru znaczy to wi\u0119cej ni\u017c kt\u00f3rykolwiek punkt benchmarku w tym wpisie.<\/p>\n\n\n\n<p><a href=\"https:\/\/www.anthropic.com\/claude-fable-and-mythos-5-1\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Millennium poda\u0142o inny ciekawy przypadek<\/a>: model pom\u00f3g\u0142 zidentyfikowa\u0107 rzadki b\u0142\u0105d, kt\u00f3ry opiera\u0142 si\u0119 wyja\u015bnieniu przez cztery czy pi\u0119\u0107 lat.<\/p>\n\n\n\n<p>To pojedyncze przyk\u0142ady, a nie szerokie dowody z produkcji. Je\u015bli jednak to zachowanie utrzyma si\u0119 w skali, mo\u017ce mie\u0107 znaczenie dla d\u0142ugotrwa\u0142ych, agentowych workflow in\u017cynierskich.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Koszty cache&#8217;u w Fable przykuwaj\u0105 oko<\/strong><\/h2>\n\n\n\n<p>Cena odczytu z cache&#8217;u dla Fable spad\u0142a z 1,00 USD do 0,25 USD za milion token\u00f3w. To czyni go szczeg\u00f3lnie interesuj\u0105cym dla workflow zbudowanych wok\u00f3\u0142 wielokrotnego odpytywania tego samego du\u017cego zbioru informacji:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>repozytori\u00f3w,<\/li>\n\n\n\n<li>dokumentacji,<\/li>\n\n\n\n<li>baz wiedzy,<\/li>\n\n\n\n<li>innego trwa\u0142ego kontekstu projektu.<\/li>\n<\/ul>\n\n\n\n<p>Skalowanie paramteru \u201eeffort\u201d te\u017c mo\u017ce mie\u0107 znaczenie. <a href=\"https:\/\/www.harvey.ai\/blog\/fable-5-1-in-harvey\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Harvey zg\u0142osi\u0142, \u017ce jako\u015b\u0107 pozosta\u0142a wzgl\u0119dnie stabilna przy ni\u017cszych ustawieniach rozumowania<\/a>, a zu\u017cycie token\u00f3w wyj\u015bciowych spad\u0142o o mniej wi\u0119cej po\u0142ow\u0119.<\/p>\n\n\n\n<p>Jednocze\u015bnie wczesne pomiary og\u00f3lnej efektywno\u015bci tokenowej Fable mocno zale\u017c\u0105 od wybranego punktu odniesienia. Every zmierzy\u0142, \u017ce Fable 5.1 zu\u017cywa mniej ni\u017c po\u0142ow\u0119 token\u00f3w Opusa 5 przy por\u00f3wnywalnych wynikach w jego agencie slackowym na effortcie Medium, przy czym powtarza, a nie mierzy, szacunek Anthropic o 25-45% ni\u017cszych kosztach wzgl\u0119dem Fable 5. Artificial Analysis, jak relacjonuje Latent Space, por\u00f3wna\u0142 Fable 5.1 z Fable 5 na maksymalnym effortcie i znalaz\u0142 oko\u0142o 1,7 raza wi\u0119cej token\u00f3w wyj\u015bciowych oraz oko\u0142o 20% wy\u017cszy koszt na zadanie (3,76 USD), przy ~4% token\u00f3w wyj\u015bciowych obs\u0142u\u017conych przez modele fallbackowe Anthropic.<\/p>\n\n\n\n<p><a href=\"https:\/\/github.com\/anthropics\/claude-code\/issues\/91289\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Issue na GitHubie z 1 wrze\u015bnia<\/a> zg\u0142asza te\u017c, \u017ce Fable na \u015brednim effortcie wyczerpa\u0142 pe\u0142ny limit token\u00f3w Claude Code w nieca\u0142e 20 minut. Te wyniki mierz\u0105 r\u00f3\u017cne obci\u0105\u017cenia i konfiguracje, wi\u0119c sama rozbie\u017cno\u015b\u0107 jest u\u017cyteczn\u0105 informacj\u0105. Intensywne przetwarzanie korzystaj\u0105ce z cache&#8217;u mo\u017ce znacz\u0105co skorzysta\u0107 na nowym cenniku. Pozosta\u0142e przypadki nale\u017cy mierzy\u0107 osobno.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Oba modele wnosz\u0105 inne ryzyka<\/strong><\/h2>\n\n\n\n<p>Wzrost mo\u017cliwo\u015bci podnosi wag\u0119 zrozumienia tego, jak model zawodzi.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Astra<\/strong><\/h3>\n\n\n\n<p><a href=\"https:\/\/deploymentsafety.openai.com\/gpt-6-astra\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >System card OpenAI raportuje znacz\u0105cy spadek monitorowalno\u015bci chain-of-thought<\/a>. W testach adwersarialnych, w kt\u00f3rych modelowi polecono ukrywa\u0107 zani\u017canie wynik\u00f3w, Astra w wi\u0119kszo\u015bci przypadk\u00f3w omija\u0142a <a href=\"https:\/\/deploymentsafety.openai.com\/gpt-6-astra\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >monitor chain-of-thought OpenAI<\/a>: <a href=\"https:\/\/techwireasia.com\/2026\/09\/openai-gpt-6-astra-monitoring\/\" rel=\"nofollow\" >wykrywalno\u015b\u0107 spad\u0142a poni\u017cej 11% w te\u015bcie sandbaggingu WMDP<\/a> i do zera na wewn\u0119trznym benchmarku kodowania. OpenAI przedstawia to jako zdolno\u015b\u0107 wykazan\u0105 na polecenie, nie zaobserwowane domy\u015blne zachowanie, i nie raportuje rozumowania steganograficznego ani omijania monitora pe\u0142nego kontekstu.<\/p>\n\n\n\n<p>OpenAI zauwa\u017ca, \u017ce dalsza degradacja tego typu w przysz\u0142ych generacjach mog\u0142aby znacz\u0105co obni\u017cy\u0107 pewno\u015b\u0107 wykrywania niekt\u00f3rych form niepo\u017c\u0105danego zachowania. To szczeg\u00f3lnie istotne, w miar\u0119 jak modele dostaj\u0105 wi\u0119ksz\u0105 autonomi\u0119.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Fable<\/strong><\/h3>\n\n\n\n<p>W przypadku Fable wczesne obawy s\u0105 inne. Recenzenci Every zg\u0142aszaj\u0105 niekonsekwentne trzymanie si\u0119 zadanych limit\u00f3w, w tym liczby s\u0142\u00f3w. S\u0105 te\u017c doniesienia o halucynowanych cytowaniach podczas pracy z du\u017cymi dokumentami \u017ar\u00f3d\u0142owymi, a to istotny tryb awarii w analizie dokument\u00f3w.<\/p>\n\n\n\n<p><a href=\"https:\/\/www.anthropic.com\/claude-fable-and-mythos-5-1\" rel=\"nofollow\" >W\u0142asne informacje systemowe Anthropic r\u00f3wnie\u017c wskazuj\u0105 na ograniczenia w zakresie uczciwo\u015bci pod presj\u0105<\/a> i podporz\u0105dkowania si\u0119 promptom systemowym, dopuszczaj\u0105c co\u015b, o czym model wie, \u017ce jest nieprawd\u0105.<\/p>\n\n\n\n<p>Routing modeli dok\u0142ada kolejny aspekt operacyjny. <a href=\"https:\/\/support.claude.com\/en\/articles\/15363606-why-claude-switched-models-in-your-conversation-with-fable-5\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Cz\u0119\u015b\u0107 zapyta\u0144 z biologii jest kierowana do Opusa 5, a zapytania z obszaru cyber do Opusa 4.8<\/a>. <a href=\"https:\/\/platform.claude.com\/docs\/en\/build-with-claude\/refusals-and-fallback#what-the-response-contains\" rel=\"nofollow\" >Prze\u0142\u0105czenie jest widoczne w odpowiedzi<\/a>, ale decyduje o nim klasyfikator, nie zesp\u00f3\u0142, wi\u0119c ten sam workflow mo\u017ce by\u0107 obs\u0142ugiwany przez r\u00f3\u017cne modele w r\u00f3\u017cnych uruchomieniach. To komplikuje dok\u0142adn\u0105 reprodukcj\u0119 i czyni \u015bcie\u017ck\u0119 fallbacku kolejn\u0105 kwesti\u0105 do przetestowania.<\/p>\n\n\n\n<p>Te zachowania trzeba rozumie\u0107 w kontek\u015bcie docelowego przetwarzania oraz poziomu autonomii, jaki dajemy modelowi. Produkcyjne workflow wymagaj\u0105 ograniczonych uprawnie\u0144, walidacji, bramek jako\u015bci i bezpiecze\u0144stwa, audytowalno\u015bci i jasnej odpowiedzialno\u015bci po stronie cz\u0142owieka.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Rezydencja danych mo\u017ce rozstrzygn\u0105\u0107, zanim zrobi\u0105 to benchmarki<\/strong><\/h2>\n\n\n\n<p>Dla europejskich organizacji jako\u015b\u0107 modelu bywa drugorz\u0119dna wobec ogranicze\u0144 wdro\u017ceniowych. I to mo\u017ce by\u0107 <strong>najbardziej praktyczny fakt w ca\u0142ym tym wpisie<\/strong>. W chwili pisania <a href=\"https:\/\/www.harvey.ai\/blog\/fable-5-1-in-harvey\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Harvey podaje, \u017ce Anthropic nie zapewnia regionalnego przetwarzania<\/a> dla Fable 5.1 ani Fable 5, co oznacza, \u017ce dane s\u0105 przetwarzane w Stanach Zjednoczonych.<\/p>\n\n\n\n<p>Przewodnik migracyjny OpenAI wskazuje z kolei, \u017ce tryby fast i priority Astry s\u0105 obecnie niedost\u0119pne przy rezydencji danych w UE.<\/p>\n\n\n\n<p>Te warunki mog\u0105 si\u0119 szybko zmieni\u0107 i zawsze trzeba je zweryfikowa\u0107 dla konkretnego modelu, trybu i konfiguracji wdro\u017cenia przed implementacj\u0105. Dla oblicze\u0144 obj\u0119tych wymaganiami rezydencji danych architektura wdro\u017cenia mo\u017ce zaw\u0119zi\u0107 wyb\u00f3r modelu, zanim w og\u00f3le zacznie si\u0119 benchmarking wydajno\u015bci.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Poza kodowaniem obraz pozostaje niepe\u0142ny<\/strong><\/h2>\n\n\n\n<p>W obci\u0105\u017ceniach naukowych jest kilka naprawd\u0119 ciekawych przypadk\u00f3w u\u017cycia.<\/p>\n\n\n\n<p><a href=\"https:\/\/epoch.ai\/latest\/announcing-frontiermath-erdos\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Benchmark FrontierMath Erd\u0151s od Epoch AI<\/a> u\u017cy\u0142 68 nierozwi\u0105zanych problem\u00f3w Erd\u0151sa sformalizowanych w Leanie, z bud\u017cetem 300 USD i 72 godzin na problem. Astra rozwi\u0105za\u0142a dwa, oko\u0142o 3%. Sol, GPT-5.5, Fable 5.1 i Fable 5 zako\u0144czy\u0142y prac\u0119 bez sukcesu.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Bia\u0142ka<\/strong><\/h3>\n\n\n\n<p>Projektowanie bia\u0142ek to kolejny przyk\u0142ad.<\/p>\n\n\n\n<p><a href=\"https:\/\/www.anthropic.com\/research\/Claude-accelerates-protein-design\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Badanie Anthropic zwalidowane w mokrym laboratorium<\/a>, z projektami wyprodukowanymi i przetestowanymi niezale\u017cnie przez Adaptyv Bio i Twist Bioscience, raportuje, \u017ce Claude Mythos Preview osi\u0105gn\u0105\u0142 35,1% hit rate przy jednym celu na 24-godzinn\u0105 sesj\u0119 (26,7% w konfiguracji wielocelowej, 22,6% dla Opusa 4.8), wobec bazowych 10-15%, kt\u00f3re Anthropic wyprowadzi\u0142 z proteinbase.com. Mythos Preview nie jest og\u00f3lnie dost\u0119pny, a Anthropic zapowiada dalsz\u0105 charakteryzacj\u0119, \u017ceby potwierdzi\u0107 te wska\u017aniki.<\/p>\n\n\n\n<p>Jest tu <strong>wa\u017cne zastrze\u017cenie<\/strong>: Fable 5.1 kieruje zapytania biologiczne do Opusa 5 i oficjalnie nie jest rekomendowany do profesjonalnych bada\u0144 biologicznych.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Robotyka<\/strong><\/h3>\n\n\n\n<p><strong>Robotyka <\/strong>dostarcza kolejnego przyk\u0142adu. W <a href=\"https:\/\/openai.robocurve.org\/gpt-6-astra\/\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >zadaniu Robocurve<\/a> \u201eklocek do miski\u201d, z tym samym harnessem dla wszystkich trzech modeli, Fable 5 trafi\u0142 1\/20, Fable 5.1 8\/20, a Astra 19\/20. W trudniejszym wk\u0142adaniu elementu uk\u0142adanki Astra i Fable 5.1 zaliczy\u0142y po 2\/20 i zatrzyma\u0142y si\u0119 na tym samym kroku.<\/p>\n\n\n\n<p>Robocurve zg\u0142asza jednak <strong>kilka zastrze\u017ce\u0144<\/strong>: r\u00f3\u017cne stanowiska dla przebieg\u00f3w z misk\u0105, nieprzeplatane pr\u00f3by w odst\u0119pie dw\u00f3ch dni i ocena przez operatora, poza \u015blep\u0105 pr\u00f3b\u0105. O ile post\u0119p jest zauwa\u017calny, o tyle precyzyjna manipulacja pozostaje w du\u017cej mierze nierozwi\u0105zana.<\/p>\n\n\n\n<p>Luki w pokryciu badaniami s\u0105 r\u00f3wnie ciekawe \u2013 wci\u0105\u017c nie ma znacz\u0105cych, udokumentowanych wdro\u017ce\u0144 produkcyjnych \u017cadnego z modeli w wielu typowych domenach enterprise. Szczeg\u00f3lnie brakuje niezale\u017cnych ewaluacji dla arkuszy kalkulacyjnych i danych tabelarycznych, mimo ich wagi w codziennej pracy biurowej.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Sprawozdania<\/strong><\/h3>\n\n\n\n<p><a href=\"https:\/\/openai.com\/index\/legora-financial-statement-review-with-astra\/\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Jeden konkretny przyk\u0142ad biznesowy pochodzi od Legory<\/a>. W zadaniu uzgadniania sprawozda\u0144 finansowych na 41 dokumentach Astra znalaz\u0142a w kilka minut wszystkie cztery pod\u0142o\u017cone b\u0142\u0119dy, co da\u0142o oko\u0142o 40% poprawy w tym workflow. W ca\u0142ym benchmarku \u015brednia poprawa by\u0142a jednak bli\u017csza 3%. T\u0119 r\u00f3\u017cnic\u0119 warto pami\u0119ta\u0107 przy ocenie efektownych demonstracji. Wyniki ze starannie dobranych zada\u0144 mog\u0105 znacz\u0105co odbiega\u0107 od \u015bredniej wydajno\u015bci w szerszym procesie delivery.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Migracja to wi\u0119cej ni\u017c zmiana konfiguracji<\/strong><\/h2>\n\n\n\n<p>Obaj vendorzy opublikowali przewodniki migracyjne i wymieniaj\u0105 w nich istotne breaking changes.<\/p>\n\n\n\n<p><a href=\"https:\/\/platform.claude.com\/docs\/en\/models\/fable-5-1\/whats-new-fable-5-1\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Anthropic udost\u0119pnia osobne \u015bcie\u017cki migracji w zale\u017cno\u015bci od poprzedniego modelu<\/a>. Cz\u0119\u015b\u0107 zachowa\u0144, na kt\u00f3rych mog\u0105 polega\u0107 istniej\u0105ce systemy, nie jest ju\u017c wspierana, w tym wymuszone wywo\u0142ania narz\u0119dzi, prefill odpowiedzi asystenta i wy\u0142\u0105czanie rozumowania.<\/p>\n\n\n\n<p>Jest te\u017c subtelna zmiana wok\u00f3\u0142 \u015blad\u00f3w rozumowania. S\u0105 one zwi\u0105zane z modelem, kt\u00f3ry je wygenerowa\u0142, wi\u0119c edycja wcze\u015bniejszych cz\u0119\u015bci rozmowy mo\u017ce je uniewa\u017cni\u0107 i spowodowa\u0107 b\u0142\u0105d \u017c\u0105dania. Frameworki, kt\u00f3re same kompaktuj\u0105 kontekst, przebudowuj\u0105 listy narz\u0119dzi mi\u0119dzy wywo\u0142aniami albo wstrzykuj\u0105 przypomnienia w ka\u017cdej turze, mog\u0105 wi\u0119c wymaga\u0107 zmian.<\/p>\n\n\n\n<p><a href=\"https:\/\/developers.openai.com\/api\/docs\/guides\/latest-model\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Lista migracyjna OpenAI jest kr\u00f3tsza<\/a>, ale istniej\u0105ce integracje i tak mog\u0105 wymaga\u0107 pracy in\u017cynierskiej. Usuni\u0119to popularne parametry samplingu, najni\u017csze ustawienie rozumowania nie jest ju\u017c wspierane, a wywo\u0142ywanie narz\u0119dzi oczekuje nowszej powierzchni API.<\/p>\n\n\n\n<p>Cz\u0119\u015b\u0107 zmian w zachowaniu trudniej wykry\u0107, bo niekoniecznie ko\u0144cz\u0105 si\u0119 b\u0142\u0119dem: mniej r\u00f3wnoleg\u0142ych wywo\u0142a\u0144 narz\u0119dzi, mniej retrievalu przy niskim effortcie, g\u0119stsza proza albo przepisanie ca\u0142ego pliku tam, gdzie oczekiwano punktowej edycji. To zmiany, kt\u00f3re wy\u0142apie recenzent wiedz\u0105cy, jak wynik wygl\u0105da\u0142 wcze\u015bniej.<\/p>\n\n\n\n<p>Dla zespo\u0142u delivery oznacza to, <strong>\u017ce upgrade modelu jest release&#8217;em i jak ka\u017cdy release potrzebuje zestawu test\u00f3w regresyjnych.<\/strong><\/p>\n\n\n\n<p>W\u0142asne wytyczne Anthropic dotycz\u0105ce ewaluacji agent\u00f3w ujmuj\u0105 to wprost: zespo\u0142y z evalami migruj\u0105 w dni, zespo\u0142y bez nich sp\u0119dzaj\u0105 tygodnie na testowaniu r\u0119cznym. Taki zestaw musi uwzgl\u0119dnia\u0107 dwie rzeczy. Testowany system jest niedeterministyczny, wi\u0119c liczy si\u0119 nie to, czy zadanie przejdzie raz, ale jak niezawodnie przechodzi w powtarzanych uruchomieniach. Obaj vendorzy podkre\u015blaj\u0105 te\u017c, \u017ce modele testuj\u0105 w\u0142asn\u0105 prac\u0119, tymczasem agent mo\u017ce przenie\u015b\u0107 to samo niezrozumienie wymagania do kodu i do test\u00f3w, wi\u0119c same zielone testy nie dowodz\u0105, \u017ce wymaganie zosta\u0142o spe\u0142nione.<\/p>\n\n\n\n<p>Ma to konsekwencj\u0119 architektoniczn\u0105 dla system\u00f3w AI-native. Modele b\u0119d\u0105 si\u0119 zmienia\u0107, a wraz z nimi ich interfejsy i zachowania. Workflow delivery potrzebuj\u0105 na tyle du\u017cej modularno\u015bci, \u017ceby da\u0142o si\u0119 ocenia\u0107 i wymienia\u0107 zdolno\u015bci AI bez przebudowywania ca\u0142ego procesu przy ka\u017cdym nowym flagowcu: wielokrotnego u\u017cytku kontekstu, workflow i mechanizm\u00f3w kontroli, kt\u00f3re prze\u017cyj\u0105 ka\u017cdy pojedynczy model.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Od czego zacz\u0119liby\u015bmy testy<\/strong><\/h2>\n\n\n\n<p>Dowod\u00f3w nie starcza na uniwersalny ranking. Starcza za to na wskazanie rozs\u0105dnych punkt\u00f3w startowych, a taki research jest czasoch\u0142onny, wi\u0119c zamiast listy lektur dajemy Wam tabel\u0119. Aspekty zwi\u0105zane z kodowaniem pozostaj\u0105 szczeg\u00f3lnie trudne do rozstrzygni\u0119cia.<\/p>\n\n\n\n<p><a href=\"https:\/\/x.com\/arena\/status\/2096290434700247250\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Astra jest na szczycie Code Arena: WebDev<\/a> (1797 vs 1762) i <a href=\"https:\/\/www.datacamp.com\/blog\/gpt-6-astra-vs-claude-fable-5-1\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Terminal-Bench 4.0<\/a> (57,7% vs 55,8%), prowadzi te\u017c o siedem punkt\u00f3w w DeepSWE oraz w FrontierCode 1.1.<\/p>\n\n\n\n<p><a href=\"https:\/\/www.anthropic.com\/claude-fable-5-1-mythos-5-1-system-card\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >81,2% Fable 5.1 na SWE-bench Pro<\/a> nie ma odpowiednika po stronie Astry, kt\u00f3ry da\u0142oby si\u0119 pobi\u0107. <a href=\"https:\/\/thezvi.substack.com\/p\/claude-mythos-51-and-fable-51-capabilities\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Wczesna ankieta w\u015br\u00f3d czytelnik\u00f3w Zviego<\/a> wyl\u0105dowa\u0142a blisko 50:50, w d\u00f3\u0142 z 2:1 na korzy\u015b\u0107 Claude&#8217;a.<\/p>\n\n\n\n<p>Wybrany benchmark mo\u017ce wi\u0119c zdecydowa\u0107 o tym, kto wygl\u0105da na zwyci\u0119zc\u0119.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><tbody><tr><td class=\"has-text-align-center\" data-align=\"center\"><strong>Zadanie<\/strong><\/td><td class=\"has-text-align-center\" data-align=\"center\"><strong>Punkt startowy do ewaluacji<\/strong><\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Pisanie, edycja i ton<\/td><td class=\"has-text-align-center\" data-align=\"center\">Fable 5.1<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Obs\u0142uga aplikacji i interfejs\u00f3w<\/td><td class=\"has-text-align-center\" data-align=\"center\">Astra<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">D\u0142ugie, nienadzorowane przebiegi in\u017cynierskie<\/td><td class=\"has-text-align-center\" data-align=\"center\">Fable 5.1<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Matematyka i wybrane obci\u0105\u017cenia naukowe<\/td><td class=\"has-text-align-center\" data-align=\"center\">Astra<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Wielokrotne zapytania na tym samym du\u017cym kontek\u015bcie<\/td><td class=\"has-text-align-center\" data-align=\"center\">Fable 5.1<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Rezydencja danych w UE<\/td><td class=\"has-text-align-center\" data-align=\"center\"><a href=\"https:\/\/developers.openai.com\/api\/docs\/guides\/latest-model#update-api-and-model-parameters\" target=\"_blank\" rel=\"noopener\" title=\"\" rel=\"nofollow\" >Najpierw zweryfikowa\u0107 aktualne opcje wdro\u017cenia<\/a><\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">Proste, wra\u017cliwe kosztowo zadania w j\u0119zyku polskim<\/td><td class=\"has-text-align-center\" data-align=\"center\">W\u0142\u0105czy\u0107 do testu r\u00f3wnie\u017c mniejsze modele<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p>Te rekomendacje nale\u017cy traktowa\u0107 jako punkty wyj\u015bcia do ewaluacji. Faktyczny wyb\u00f3r zale\u017cy od zagadnienia, kontekstu projektu, wymaganych integracji, akceptowalnego ryzyka, ogranicze\u0144 governance i ca\u0142kowitej ekonomii.<\/p>\n\n\n<div class=\"nsw-o-blogersii-banner\">\n            <picture>\n            <source srcset=\"https:\/\/sii.pl\/blog\/wp-content\/uploads\/2026\/04\/Blog-Testing-Lab-Desktop_.jpg\" media=\"(min-width: 992px)\" >\n            <source srcset=\"https:\/\/sii.pl\/blog\/wp-content\/uploads\/2026\/04\/Blog-Testing-Lab-Mob_.jpg\" media=\"(min-width: 300px)\" >            <img decoding=\"async\" src=\"https:\/\/sii.pl\/blog\/wp-content\/uploads\/2026\/04\/Blog-Testing-Lab-Desktop_.jpg\" alt=\"\"  class=\"\"  >\n        <\/picture>\n        <div class=\"cnt\">\n                    <div class=\"nsw-m-title-block -h3 -invert  -has-title-margin-bottom-0 -has-title-font-weight-bold\">\n                                <h2 class=\"nsw-m-title-block__title\" >Testing &#038; QA<\/h2>\n                <\/div>\n                            <p class=\"has-nsw-p-4-font-size has-invert-color\">\n                Zapewnij jako\u015b\u0107, wydajno\u015b\u0107 i bezpiecze\u0144stwo swojego oprogramowania dzi\u0119ki naszym us\u0142ugom testowania i automatyzacji test\u00f3w.\n            <\/p>\n                            <a  href=\"https:\/\/sii.pl\/oferta\/testing-qa\/\" class=\"nsw-a-button -ghost -banner-button\"   >\n        <span>Oferta Testing&amp;QA<\/span>\n    <\/a>\n            <\/div>\n<\/div>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Co m\u00f3wi nam pierwszy tydzie\u0144<\/strong><\/h2>\n\n\n\n<p>Cztery pytania wci\u0105\u017c trudno rozstrzygn\u0105\u0107 jednoznacznie:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>kt\u00f3ry model jest og\u00f3lnie m\u0105drzejszy,<\/li>\n\n\n\n<li>jak efektywny naprawd\u0119 jest Fable w r\u00f3\u017cnych workflow,<\/li>\n\n\n\n<li>jak por\u00f3wnywa\u0107 Astr\u0119 na ARC-AGI-3,<\/li>\n\n\n\n<li>kt\u00f3ry model prowadzi w pracy agentowej.<\/li>\n<\/ul>\n\n\n\n<p>Dla ka\u017cdego z nich mo\u017cna znale\u017a\u0107 pomiary, kt\u00f3rych wyniki r\u00f3\u017cni\u0105 si\u0119 mi\u0119dzy sob\u0105 bardziej ni\u017c modele, kt\u00f3re maj\u0105 por\u00f3wnywa\u0107. Dlatego bardziej miarodajnych wniosk\u00f3w warto szuka\u0107 gdzie indziej.<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li>ARC-AGI-3 pokazuje, jak mocno orkiestracja i otaczaj\u0105ca architektura mog\u0105 wp\u0142yn\u0105\u0107 na zmierzon\u0105 zdolno\u015b\u0107.<\/li>\n\n\n\n<li>100-godzinny eksperyment pokazuje, \u017ce szybko\u015b\u0107 i ca\u0142kowity koszt mog\u0105 wskazywa\u0107 w r\u00f3\u017cne strony.<\/li>\n\n\n\n<li><em>Computer use<\/em> otwiera nowe mo\u017cliwo\u015bci automatyzacji, a razem z nimi nowe wymagania wok\u00f3\u0142 to\u017csamo\u015bci, uprawnie\u0144, zarz\u0105dzania sekretami, logowania audytowego i odzyskiwania sesji.<\/li>\n\n\n\n<li>4, Przewodniki migracyjne obu vendor\u00f3w pokazuj\u0105, \u017ce zmiana modelu mo\u017ce wp\u0142yn\u0105\u0107 na zarz\u0105dzanie kontekstem, narz\u0119dzia i zachowanie aplikacji.<\/li>\n\n\n\n<li>Zamiast ocenia\u0107 sam model, trzeba ocenia\u0107 ca\u0142y proces, w kt\u00f3rym model pracuje.<\/li>\n<\/ol>\n\n\n\n<p>Warto zacz\u0105\u0107 od dw\u00f3ch-trzech zada\u0144, kt\u00f3re maj\u0105 znaczenie w Waszym \u015brodowisku. Uruchomi\u0107 modele kandydackie na realistycznym kontek\u015bcie projektu. Nast\u0119pnie u\u017cy\u0107 narz\u0119dzi, integracji i mechanizm\u00f3w kontroli, kt\u00f3re istnia\u0142yby na produkcji.<\/p>\n\n\n\n<p>Pozostaje ocena jako\u015bci, pomiar czasu uko\u0144czenia zadania, prze\u015bledzenie pora\u017cki i podsumowanie ca\u0142kowitych koszt\u00f3w, a finalnie <strong>decyzja in\u017cynierska lub biznesowa na podstawie tych wynik\u00f3w.<\/strong><\/p>\n\n\n\n<p>Tydzie\u0144 po premierze leaderboard b\u0119dzie si\u0119 dalej zmienia\u0142. Proces ewaluacji oparty na obci\u0105\u017ceniach pozostanie u\u017cyteczny d\u0142ugo po tym.<\/p>\n\n\n<div class=\"kk-star-ratings kksr-auto kksr-align-left kksr-valign-bottom\"\n    data-payload='{&quot;align&quot;:&quot;left&quot;,&quot;id&quot;:&quot;34845&quot;,&quot;slug&quot;:&quot;default&quot;,&quot;valign&quot;:&quot;bottom&quot;,&quot;ignore&quot;:&quot;&quot;,&quot;reference&quot;:&quot;auto&quot;,&quot;class&quot;:&quot;&quot;,&quot;count&quot;:&quot;2&quot;,&quot;legendonly&quot;:&quot;&quot;,&quot;readonly&quot;:&quot;&quot;,&quot;score&quot;:&quot;5&quot;,&quot;starsonly&quot;:&quot;&quot;,&quot;best&quot;:&quot;5&quot;,&quot;gap&quot;:&quot;2&quot;,&quot;greet&quot;:&quot;&quot;,&quot;legend&quot;:&quot;5\\\/5&quot;,&quot;size&quot;:&quot;30&quot;,&quot;title&quot;:&quot;Nowe modele AI w praktyce: co Fable 5.1 i GPT-6 Astra m\u00f3wi\u0105 nam o AI-native delivery&quot;,&quot;width&quot;:&quot;159&quot;,&quot;_legend&quot;:&quot;{score}\\\/5&quot;,&quot;font_factor&quot;:&quot;1.25&quot;}'>\n            \n<div class=\"kksr-stars\">\n    \n<div class=\"kksr-stars-inactive\">\n            <div class=\"kksr-star\" data-star=\"1\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"2\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"3\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"4\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"5\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n    <\/div>\n    \n<div class=\"kksr-stars-active\" style=\"width: 159px;\">\n            <div class=\"kksr-star\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 2px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 30px; height: 30px;\"><\/div>\n        <\/div>\n    <\/div>\n<\/div>\n                \n\n<div class=\"kksr-legend\" style=\"font-size: 24px;\">\n            5\/5    <\/div>\n    <\/div>\n","protected":false},"excerpt":{"rendered":"<p>Dwa nowe flagowe modele, tydzie\u0144 pierwszych test\u00f3w i sporo szumu wok\u00f3\u0142 ich mo\u017cliwo\u015bci. Pierwsze wyniki ju\u017c m\u00f3wi\u0105 co\u015b u\u017cytecznego o &hellip; <a class=\"continued-btn\" href=\"https:\/\/sii.pl\/blog\/nowe-modele-ai-w-praktyce-co-fable-5-1-i-gpt-6-astra-mowia-nam-o-ai-native-delivery\/\">Continued<\/a><\/p>\n","protected":false},"author":824,"featured_media":34846,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"_editorskit_title_hidden":false,"_editorskit_reading_time":0,"_editorskit_is_block_options_detached":false,"_editorskit_block_options_position":"{}","inline_featured_image":false,"footnotes":""},"categories":[1317],"tags":[13635,12795,11675,682,1032],"class_list":["post-34845","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-testowanie","tag-openai","tag-agentic-testing","tag-anthropic","tag-artificial-intelligence","tag-case-study"],"acf":[],"aioseo_notices":[],"republish_history":[],"featured_media_url":"https:\/\/sii.pl\/blog\/wp-content\/uploads\/2026\/09\/AI_3-1.jpg","category_names":["Testowanie"],"_links":{"self":[{"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/posts\/34845","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/users\/824"}],"replies":[{"embeddable":true,"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/comments?post=34845"}],"version-history":[{"count":3,"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/posts\/34845\/revisions"}],"predecessor-version":[{"id":34864,"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/posts\/34845\/revisions\/34864"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/media\/34846"}],"wp:attachment":[{"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/media?parent=34845"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/categories?post=34845"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/sii.pl\/blog\/wp-json\/wp\/v2\/tags?post=34845"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}