Mentionsy Mentionsy
Better Dev Club
Better Dev Club

Better Dev Club #32 - Wojna benchmarków, nowe modele MAI i powrót do on-premise?

11.06.2026 ·25 min 48 s · 4 rozdziały

Kajetan i Piotrek biorą pod lupę najświeższą wojnę na benchmarki wywołaną głośną premierą rodziny modeli Claude 5 (w tym Mythos 5, Fable 5 i Opus 4.8) oraz niespodziewanym debiutem własnych modeli MAI od Microsoftu. Rozmawiamy o twardych liczbach z Agentic Coding Terminal Bench 2.1 oraz Humanity Last Exam, zderzając je z realnymi kosztami. Czy czeka nas przejście z subskrypcji na token-based billing? \n\nW drugiej części odcinka analizujemy niesamowity model do kodowania od Microsoftu, który ma być tańszy od Haiku i dorównywać Sonnetowi 4.6. Zastanawiamy się też, czy wysokie ceny tokenów w chmurze nie popchną firm do powrotu do on-premise, zwłaszcza w dobie premier sprzętu takiego jak Surface RTX Devbox czy lokalnego uruchamiania modeli pokroju Google Gemma bezpośrednio na naszych Macach. „Dzisiaj używamy najgorszych modeli, jakich będziemy w życiu używać”.00:00 - [Intro] Testowanie najnowszych modeli: Gemma, MAI, Mythos i Fable 501:12 - [Benchmarki] Wojna na liczby i szczegóły Agentic Coding Terminal Bench 2.105:10 - [Humanity Last Exam] Czy Fable 5 i Claude Opus 4.8 oznaczają nadchodzący Skynet?08:22 - [Strategia] Wielkie modele Anthropic vs małe, zoptymalizowane rozwiązania Google i Microsoftu09:30 - [Cybersecurity] Udostępnianie Fable 5 a podsuwanie hakerom nowego pola do popisu10:30 - [Małe modele] Nowe, wyspecjalizowane modele od Microsoftu – poziom Sonneta 4.6 za ułamek ceny?12:50 - [Przyszłość] Dzisiejsze modele to najgorsze wersje, jakich będziemy używać w życiu13:59 - [Koszty] Koniec darmowych subskrypcji? Anthropic przechodzi na token-based billing19:49 - [Sprzęt] Surface RTX Devbox i Nvidia DGX – potężne maszyny do lokalnego uruchamiania AI22:29 - [On-premise] Czy koszty chmury wypchną firmy z powrotem na własną infrastrukturę?23:58 - [Lokalna Gemma] Uruchamianie modeli na Macu M2 Pro i satysfakcjonujące 30 tokenów na sekundę25:18 - [Outro] Jak zmienia się Wasz codzienny workflow w erze lokalnego AI?#betterdevclub #ai #benchmarks #claude5 #fable #mythos #mai #microsoft #google #on-premise #gemma #surfacertxdevbox #hardware #cybersecurity

1:11 · Benchmarkowanie modeli 3

Gemini Pro ma 70,3%, czyli 0,4% różnicy. Nie wiem, to jest pewnie ten Terminus II Harness. Clouder Opus ma 66,1%, GPT 5,5% ma 78%, czyli jest w ogóle 5% słabszy niż w Clodzie. Literalnie czytam ten sam benchmark, tylko z tym właśnie harnessem, albo bez tego harnessu, a Gemini Flash jest na poziomie 76,2%. Czyli rzeczywiście nadal, jak gdyby, ten najnowszy model jest najbardziej dobry, ale to jest chyba jedyny, który znalazłem, który słuchajcie, jest taki sam, a nie, jest jeszcze Humanity Last Exam, o którym żeśmy kiedyś dyskutowali.

Jak słuchaczu nie pamiętasz, to dawno, to na początku dawno, tam z pół roku, tam w ogóle inna epoka, żeśmy dyskutowali o Humanity Last Exam. To one są... czekaj, Humanity Last Exam... Pewna liczba, okazuje się, że wcale nie jest takie łatwe. No to tak, Humanty Last Exam, Gemini 3.5 Flash daje radę 40,2%, Clouder Opus 46,9%, GPT 5.5 41,4% i to są dane z Googla, a w A w clodzie jest Bez stuli, Fable 5, Mythos 5. 59 bez stuli, 64,5 z stulami.

Dobra, Mythos preview, nie chce mi się czytać, bo nie ten. I weźmy sobie GPT 5,5, żebyśmy mieli jakiekolwiek porównanie. 41 i 4. O Jezu, i teraz zgubiłem. A dobra, tu było 41,4. O, to jest to samo! Hu hu hu, wreszcie mamy coś, co można porównywać. I Gemini 3,5 Pro też tak samo 44,4. Więc na chwilę NT Last Exam, słuchajcie, nadal, nadal... No nie no, dobra, niby Fable 5 jest powyżej 50%. A z tronami 64,5 znaczy, że koniec Skynet. Dobra. Przepraszam za ten strasznie długi wstęp i żonglowanie liczbami, ale dałem jakieś liczby.

Pokazano wszystkie 3 dopasowania. Transkrypcja generowana automatycznie i niesprawdzana ręcznie — może zawierać błędy.