Google właśnie zaprezentował swój najbardziej zaawansowany model audio. Oto jak wypada w rankingu

9 godzin temu

Google wprowadziło Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking 15 września, nazywając je swoimi najbardziej zaawansowanymi modelami audio.

Oba modele rozmawiają, rozumują i wykonują zadania. Jak wypadają u niezależnych analityków? Wersja Extended Thinking zajęła pierwsze miejsce w indeksie speech-to-speech stworzonym przez Artificial Analysis z wynikiem 82,6, przed GPT-Live-1 i Grok Voice.

Śledź nas na X, aby otrzymywać najnowsze informacje na bieżąco

Say “hi” to our most advanced audio models from @GoogleDeepMind yet built for natural, production-ready voice applications.

🔷 Gemini 3.8 Live
🔷 Gemini 3.8 Live Extended Thinking

With these models, you can speak naturally, collaborate easily, and tackle complex tasks using… pic.twitter.com/TCcuANcIWl

— Google (@Google) September 15, 2026

Jak benchmarki oceniają najnowszy konwersacyjny model AI od Google

Indeks Artificial Analysis uwzględnia rozumowanie mowy, wydajność agentyczną, preferencje areny i skuteczność w zadaniach.

Gemini 3.8 Live Extended Thinking, testowany przy wysokim wysiłku rozumowania, zadebiutował na pierwszym miejscu. Zaraz za nim uplasował się GPT-Live-1 Astra z wynikiem 81,5 i Grok Voice Think Fast 2.0 High z wynikiem 81,3.

Jak Gemini 3.8 Live wypadł w indeksie speech-to-speech. Źródło: Artificial Analysis

Standardowy Gemini 3.8 Live zajął piąte miejsce z wynikiem 76,0. Obie wersje pobiły model Gemini 3.1 Flash Live High, który zdobył 71,5.

Różnica w wydajności agentów pozostało większa. Extended Thinking osiągnął 68,6% w benchmarku tau voice, podczas gdy poprzednia generacja miała tylko 37,7%.

W benchmarku rozumowania mowy Extended Thinking uzyskał wynik 97,7%, wyprzedzając Grok Voice z wynikiem 97,2%. Jednak ustępuje modelowi Qwen Audio 3.0 Realtime Plus, który zdobył 99,2%.

Testerzy przez cały czas wybierają starszy model Gemini

Cena wyznacza największą różnicę. Standardowy model kosztuje 0,84 USD za godzinę wejściowego audio. To około połowa ceny poprzednika – 1,75 USD i najniższa stawka w indeksie.

Extended Thinking kosztuje 3,50 USD za godzinę. To mniej niż GPT-Live-1 Sol za 4,47 USD oraz Grok Voice Think Fast 2.0 High za 4,80 USD.

Opóźnienie także spadło. Średni czas do pierwszego audio wynosi w tej chwili 1,18 sekundy, w porównaniu do 2,99 sekundy w starszym Gemini.

Jednak słuchacze wciąż nie są przekonani. Gemini 3.1 Flash Live przez cały czas wygrywa w preferencjach w ślepych rozmowach Speech Agent Arena i osiąga Elo 1096.

Gemini 3.8 Live zajmuje drugie miejsce z wynikiem 1083. Wersja Extended Thinking zajmuje trzecie miejsce z wynikiem 990, mimo realizacji 89,1% zadań.

Sztuczna inteligencja głosowa jest dziś oceniana dwoma skalami, które wskazują różne kierunki. Benchmarki nagradzają rozumowanie. Preferencje słuchaczy nagradzają lepszą mowę. Google prowadzi w obu przypadkach, ale różnymi modelami.

Subskrybuj nasz kanał na YouTube, by oglądać ekspertów i dziennikarzy dzielących się analizami

BeInCrypto Polska - Google właśnie zaprezentował swój najbardziej zaawansowany model audio. Oto jak wypada w rankingu

Idź do oryginalnego materiału