Współzałożyciel Ethereum, Vitalik Buterin, twierdzi, iż lokalna sztuczna inteligencja (AI) jest już blisko przejęcia znacznej części codziennych zadań. Uruchomił Qwen3.8-Flash-Next od Alibaba na własnym laptopie i opublikował wyniki prędkości.
W przeciwieństwie do ChatGPT, ten system nigdy nie łączy się z serwerem w chmurze. Model działa na komputerze i samodzielnie odpowiada na żądania.
Test lokalnej AI Vitalika Buterina pokazuje użyteczną prędkość
Jego laptop korzysta z chipu Strix Halo od AMD. Większość komputerów dzieli pracę między procesor i oddzielną kartę graficzną, a każda ma własną pulę pamięci. Strix Halo umieszcza oba komponenty na jednym kawałku krzemu i pozwala im dzielić jedną pulę pamięci.
To rozwiązanie ma znaczenie, bo model AI musi mieścić się w pamięci, zanim zacznie działać. Typowa karta graficzna oferuje od 8 do 24 gigabajtów, co jest zdecydowanie za mało dla tego typu modelu. Komputery z układem Strix Halo mają choćby 128 gigabajtów pamięci dostępnej dla obu części chipu. Jeden laptop może więc uruchomić model, który do niedawna wymagał serwerów.
Podane przez niego prędkości wystarczają do zwykłej pracy. Krótkie polecenia pojawiały się szybko, w tempie wygodnym do czytania. Przy poleceniach liczących dziesiątki tysięcy słów wydruk zwalniał, więc bardzo długie dokumenty są słabym punktem.
Alibaba opublikowała ogólnodostępne wagi 26 sierpnia. Zespół podaje, iż model ma 125 mld parametrów, a jednocześnie aktywuje jedynie 6 mld, co pozwala utrzymać umiarkowane wymagania pamięciowe.
Buterin nazwał go Qwen3.8-Flash, choć Alibaba udostępnia wersję do pobrania jako Qwen3.8-Flash-Next. Jego większy odpowiednik, Qwen3.8-Max, osiągnął wysokie wyniki w testach porównawczych w sierpniu.
Qwen 3.8 flash is truly impressive, and llama.cpp has been rapidly getting better and better at processing it
columns are: pre-existing prompt, new prompt, generated, input tok/s, output tok/s
This is on my laptop (strix halo). I think we're very close to the point where you… pic.twitter.com/v5Ze4Fv5Wr
Dlaczego prywatność zmienia zasady gry
Buterin podkreśla drugi istotny aspekt poza samą prędkością. Lokalny model odpowiada na urządzeniu, więc dostawca nigdy nie otrzymuje zapytania.
Do bardziej wymagających zadań proponuje podział pracy. Lokalny model obsługuje tyle, ile może, a następnie usuwa wrażliwe dane z tego, co wysyła potem do większego systemu w chmurze.
“używaj lokalnego modelu, by organizować zapytania do silniejszych modeli, tak by twoje dane osobowe nie wyciekały poza twój komputer”
W praktyce lokalny model wyciągnąłby z polecenia imiona, adresy portfeli czy prywatny kod i przesłałby dalej tylko adekwatne pytanie. Takie filtrowanie ogranicza ilość danych opuszczających urządzenie. Nie gwarantuje jednak, iż nic poufnego nie przeniknie.
To podejście pasuje do jego dotychczasowych działań. Ostrzegał przed inwigilacją podczas debaty o kontroli czatów w UE, a społeczność kryptowalutowa naciska na większe ograniczenia agentów z podobnych powodów.
Pozew zbiorowy z maja oskarża OpenAI o udostępnianie zapytań użytkowników ChatGPT firmom Meta i Google.
Dostawcy chmur przez cały czas dominują na rynku. Jednak każda poprawa wydajności lokalnej przenosi rutynowe zadania poza ich serwery, a tanie komputery ze współdzieloną pamięcią zyskują popularność.
Pozostaje pytanie, jak wiele możliwości ludzie poświęcą dla większej kontroli.
BeInCrypto Polska - Lokalna inicjatywa AI Vitalika Buterina: czy twój laptop może zastąpić ChatGPT?

11 godzin temu





