Google i Meta wypuściły najnowsze modele AI z najwyższej półki w odstępie kilku godzin w środę. Google udostępniło Gemini 3.8 Flash razem z wariantem cyberbezpieczeństwa, a Meta wypuściła Muse Spark 1.3.
Obie premiery skłaniają do bezpośredniego porównania. Niezależne testy Artificial Analysis dają podzielone wyniki. Meta wygrywa w pracy agentowej i rozumowaniu naukowym, natomiast Google jest lepsze w zapamiętywaniu faktów i kodowaniu terminalowym.
Dwie najważniejsze premiery tego samego dnia
Gemini 3.8 Flash to trzecie wydanie Flash Google w ciągu sześciu tygodni. Model kosztuje 0,75 USD za 1 mln tokenów wejściowych i 3,75 USD za 1 mln tokenów wyjściowych.
Śledź nas na X, aby być na bieżąco z najnowszymi wiadomościami
Today we’re introducing a new 3.8 Flash model, our 3rd Flash release in just 6 wks.
It delivers significant leaps from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. On DeepSWE v1.1, it outperforms most larger frontier models in autonomously… pic.twitter.com/MB5seliluh
Cena promocyjna obowiązuje do 31 grudnia 2026. Następnie ceny podwajają się do 1,50 USD i 7,50 USD za 1 mln tokenów.
Google połączyło model ogólny z Gemini 3.8 Flash Cyber. Model udostępniono wybranym obrońcom. Osiągnął wynik 86,2% w teście CyberGym, mierzącym wykrywanie luk.
Wariant cyber uzyskał także 47,2% w CWE-Bench, teście łatania błędów. Google twierdzi, iż model tworzy 2,6 razy więcej poprawnych łatek na luki w Chrome niż większe komercyjne modele.
Dostęp uzależniono od programu Fairwind, który ogranicza model do instytucji rządowych i operatorów infrastruktury krytycznej. OpenAI dzień wcześniej postawiło podobne ograniczenia przy modelu Astra, pierwszym ocenionym jako osiągającym najważniejszy próg cyberbezpieczeństwa.
Meta w tym samym czasie wprowadziła Muse Spark 1.3 przez Muse Code i Meta Model API. Inżynierowie firmy zmierzyli około 20% mniej wywołań narzędzi niż w wersji 1.2.
Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter. This is the biggest jump we've made so far on coding and agentic work. Try it in Muse Code and our API.
Next up 🍉 and Muse Spark open weights releases coming soon. pic.twitter.com/XQQEDEJGD7
Gemini 3.8 Flash kontra Muse Spark 1.3: niezależne benchmarki nie dają jednoznacznych wyników
Artificial Analysis przetestowało modele, a wyniki pokazują, jak się plasują. Muse Spark 1.3 w trybie max uzyskał 1754 Elo na GDPval-AA v2. Gemini 3.8 Flash (high) osiągnął 1545.
Meta prowadzi także w teście Sierra Research dla bankowych agentów (52,4% do 44,9%) i CritPt w rozumowaniu fizycznym. Gemini 3.8 Flash dominuje w Terminal-Bench 2.1 z wynikiem 87,6%, AA-LCR long context (81%) oraz AA-Omniscience accuracy (55%).
Gemini 3.8 Flash zdobył najwyższy wynik GPQA Diamond spośród testowanych modeli – 95%. Oba modele różnią się o jeden punkt na Humanity’s Last Exam.
Najlepsza wersja Meta nie jest dostępna od razu. Firma informuje, iż tryb max reasoning pojawi się po zakończeniu dodatkowych testów bezpieczeństwa, zostawiając wariant xhigh jako dostępny.
Ten wariant uzyskał 61 punktów w Artificial Analysis Intelligence Index, czyli o cztery więcej niż Muse Spark 1.2. Wciąż przegrywa z Claude Fable 5.1 (66) i Claude Opus 5 (63).
W kolejce już są kolejne premiery. Elon Musk zapowiedział, iż Grok 4.7 ukaże się wkrótce. To oznacza cztery przełomowe premiery w ciągu dwóch tygodni.
Zasubskrybuj nasz kanał na YouTube, aby zobaczyć opinie ekspertów i dziennikarzy
BeInCrypto Polska - Google i Meta wypuściły konkurencyjne modele AI w odstępie kilku godzin. Żaden nie wygrał: kto prowadzi?

9 godzin temu








