Mentionsy Mentionsy
Better Dev Club
Better Dev Club

Better Dev Club #32 - Wojna benchmarków, nowe modele MAI i powrót do on-premise?

11.06.2026 ·25 min 48 s · 4 rozdziały

Kajetan i Piotrek biorą pod lupę najświeższą wojnę na benchmarki wywołaną głośną premierą rodziny modeli Claude 5 (w tym Mythos 5, Fable 5 i Opus 4.8) oraz niespodziewanym debiutem własnych modeli MAI od Microsoftu. Rozmawiamy o twardych liczbach z Agentic Coding Terminal Bench 2.1 oraz Humanity Last Exam, zderzając je z realnymi kosztami. Czy czeka nas przejście z subskrypcji na token-based billing? \n\nW drugiej części odcinka analizujemy niesamowity model do kodowania od Microsoftu, który ma być tańszy od Haiku i dorównywać Sonnetowi 4.6. Zastanawiamy się też, czy wysokie ceny tokenów w chmurze nie popchną firm do powrotu do on-premise, zwłaszcza w dobie premier sprzętu takiego jak Surface RTX Devbox czy lokalnego uruchamiania modeli pokroju Google Gemma bezpośrednio na naszych Macach. „Dzisiaj używamy najgorszych modeli, jakich będziemy w życiu używać”.00:00 - [Intro] Testowanie najnowszych modeli: Gemma, MAI, Mythos i Fable 501:12 - [Benchmarki] Wojna na liczby i szczegóły Agentic Coding Terminal Bench 2.105:10 - [Humanity Last Exam] Czy Fable 5 i Claude Opus 4.8 oznaczają nadchodzący Skynet?08:22 - [Strategia] Wielkie modele Anthropic vs małe, zoptymalizowane rozwiązania Google i Microsoftu09:30 - [Cybersecurity] Udostępnianie Fable 5 a podsuwanie hakerom nowego pola do popisu10:30 - [Małe modele] Nowe, wyspecjalizowane modele od Microsoftu – poziom Sonneta 4.6 za ułamek ceny?12:50 - [Przyszłość] Dzisiejsze modele to najgorsze wersje, jakich będziemy używać w życiu13:59 - [Koszty] Koniec darmowych subskrypcji? Anthropic przechodzi na token-based billing19:49 - [Sprzęt] Surface RTX Devbox i Nvidia DGX – potężne maszyny do lokalnego uruchamiania AI22:29 - [On-premise] Czy koszty chmury wypchną firmy z powrotem na własną infrastrukturę?23:58 - [Lokalna Gemma] Uruchamianie modeli na Macu M2 Pro i satysfakcjonujące 30 tokenów na sekundę25:18 - [Outro] Jak zmienia się Wasz codzienny workflow w erze lokalnego AI?#betterdevclub #ai #benchmarks #claude5 #fable #mythos #mai #microsoft #google #on-premise #gemma #surfacertxdevbox #hardware #cybersecurity

0:00 · Witamy i omówienie nowych modeli 1

Cześć Kajtek! Cześć Piotrek! Jak tam nowe modele? Co już przetestowałeś? No, przetestowałem Gemmę. Przetestowałem, znaczy chciałem przetestować MAI, znaczy częściowo przetestowałem MAI, ale nie do końca, ale o tym zaraz. No i tego Mytosa czy Falusa, nie, nie Falusa, przepraszam. On się jakoś inaczej nazywa. No tego od Anthropica, no on dzisiaj wyszedł, więc jeszcze... Fajbu, fajbu, taka gea była. No to tego nie testowałem. A Ty?

7:42 · Analiza modeli i ich potencjału 1

To co się pojawiło, to mamy pierwszą firmę, która podbiła numer. Google się nie odważył, GPT się nie odważyło, Anthropic się właśnie odważył i podbił numerek. No i czy to będzie właśnie cokolwiek zmieniało? Moim zdaniem nie do końca. Jakby wszyscy wiesz... Fable miał być, czy Mythos miał być tym, którego boją się udostępnić. Jeszcze przecież miesiąc temu mówili, że boją się udostępnić, bo nie wiadomo co to będzie. No i nadal się boją. No ale jednak udostępnili albo powoli będą udostępniać i domyślam się, że specjalnie niczego to nie zmieni.

9:58 · Nowe modele od Microsoftu 3

To znaczy, że możemy być tylko bardziej spokojni o to, co się będzie w przyszłości działo, no bo widzimy problem taki, że Fable będzie, domyślam się, ultradrogi i tam nawet na tej subskrypcji 20 razy to będzie koniec. Nie, nie, nie, on w ogóle, to uwaga, do 22 albo 23, nie pamiętam, on w ogóle się liczy w subskrypcji, czyli tam 3 tygodnie, uprośmy sobie życie, czy tam 2 tygodnie, a potem jest tylko token based. O! Widzisz, no kurde. A ja myślałem, że Anthropic na Tokenbase przejdzie dopiero po IPO.

Dopiero jak wejdą na giełdę. A tu jednak już ich przycisnęli. No popatrz, no szokujące to jest. Ale ciekawostka. Zobacz w ogóle, to co jest w zasadzie moim zdaniem to co jest clou dzisiejszego odcinka. To jest mój moment, uważam, że to jest ten moment jak trzeba wycinać to słuchajcie teraz te 10 sekund. Anthropic nadal mówi największy, najbardziej wypasiony model. To jest ten model. A Google i Microsoft zaczynają mówić mały model, dostosowany. Cały nie taki olbrzymi, nie? Bo Google cały czas puszcza 3,5 flesza. No sorry, żeśmy się śmiali dwa tygodnie temu, że nie zdążyli w ogóle z pro.

Okej, dobra. Bo ja go jeszcze nie mam. No dobra, no za trzy tygodnie, whatever. Jak wyjdzie, to na pewno zacznę go używać, chociażby tylko po to, żeby sobie porównać. Jak przechodzimy z licencji na token-based, to wszyscy będą patrzeć na te modele, o ile już nie patrzą. A Anthropic nadal mówi ten model, ten największy, najszerszy, najwspanialszy, kosztujący Ale wiesz dlaczego? To się sprowadza do mojego przejęzyczenia z samego początku. Oni są jeszcze przed wejściem na giełdę, więc oni muszą pokazać kto na rynku ma największego.

Pokazano wszystkie 5 dopasowań. Transkrypcja generowana automatycznie i niesprawdzana ręcznie — może zawierać błędy.