Notebookcheck Logo

Co naprawdę kryje się za rekordowymi wynikami modelu Kimi K3

Ekran główny interfejsu internetowego Kimi z polem wprowadzania danych i logo K3
ⓘ Screenshot: Kimi.com / Moonshot AI
Za prostym interfejsem kryje się największy otwarty model sztucznej inteligencji
Nowy flagowy model z Chin bije rekordy wielkości, a nagłówki pojawiają się jeden po drugim. Sam serwis Moonshot plasuje model Kimi K3 za modelami Claude i GPT. Omówimy, co naprawdę oznaczają te liczby, czy kiedykolwiek będzie Pan/Pani w stanie samodzielnie uruchomić ten model, ile faktycznie kosztuje oraz co dzieje się z wprowadzonymi danymi.
AI Software Benchmark

Model Kimi K3 jest dostępny online od 16 lipca, a nagłówki sugerują, jakby Chiny właśnie wyprzedziły Stany Zjednoczone. Dzięki 2,8 bilionom parametrów jest to największy model, którego wagi mają zostać udostępnione. Niektórzy obserwatorzy już nazywają to kolejnym momentem na miarę DeepSeek.

Najciekawsze stwierdzenie dotyczące tego modelu nie pojawia się jednak w nagłówkach. Znajduje się ono na blogu technicznym firmy Moonshot. Twórca modelu pisze tam, że ogólna wydajność nadal pozostaje w tyle za najsilniejszymi modelami zastrzeżonymi, a mianowicie Claude Fable 5 i GPT-5.6 Sol. Firma, która prezentuje własny produkt i przyznaje, że nie jest on najlepszy, to rzadkość. Właśnie dlatego rekordowe wyniki zasługują na bliższe przyjrzenie się.

Omówiliśmy już samą wiadomość, że model K3 jest już dostępny i można go wypróbować bezpłatnie. Niniejszy artykuł dotyczy tego, co nastąpi później.

Pierwsze miejsce i to, co tak naprawdę mierzy

K3 wygrywa jedno ważne porównanie. W konkursie Frontend Code Arena, gdzie uczestnicy oglądają dwa wyniki obok siebie i wybierają lepszy, nie wiedząc, który model go wygenerował, K3 zajmuje pierwsze miejsce. Wyprzedza również modele Claude i GPT.

Haczyk polega na tym, że test ten mierzy gust. Użytkownicy oceniają, który interfejs internetowy bardziej im się podoba. To wiele mówi o projektowaniu, a niewiele o poprawności. Każdy, kto interpretuje to jako „Kimi pokonuje amerykańskie modele”, nie dostrzega różnicy między rankingiem preferencji a testem dokładności.

Dlaczego tabele porównawcze wymagają uważnej lektury

Firma Moonshot publikuje wyniki swoich pomiarów, a najciekawsze informacje znajdują się w przypisach. W zależności od testu porównawczego każdy model działał w innym środowisku agenta – czasami w KimiCode, czasami w Claude Code, a czasami w Codex. Są to różne warunki startowe, a nie czysty wyścig na tym samym torze.

W jednym z testów kodowania sama firma Moonshot przyznaje, że model Claude Fable 5 w 35 procentach zadań musiał korzystać z rozwiązań awaryjnych, co mogło obniżyć jego wynik. W innym teście model K3 osiąga swój najwyższy wynik jedynie dzięki technice kompresującej kontekst do 300 000 tokenów. Bez takiego zarządzania kontekstem wynik ten spada.

O tym, jak łatwo takie wyniki ulegają zmianie, świadczy ocena przeprowadzona przez niezależną firmę analityczną Artificial Analysis. W tym badaniu model Kimi K3 osiąga wynik 49 procent w wskaźniku halucynacji. Brzmi to jak słaby wynik. Skala jest jednak odwrócona: mierzy ona, jak często model nie popełnia błędów. Im wyższy wynik, tym lepiej, a na tej samej liście model Claude Fable 5 plasuje się poniżej K3 z wynikiem 45 procent, a kilka wariantów GPT-5.6 pozostaje daleko w tyle.

Warto pamiętać o jednej zasadzie: zanim uwierzy Pan/Pani w nagłówek dotyczący wyników testów porównawczych, proszę sprawdzić, co dokładnie zostało zmierzone i w którą stronę wskazuje skala.

Czy można samodzielnie uruchomić model K3?

Dla naszych czytelników to jest prawdziwe pytanie. Szczera odpowiedź brzmi: dla zwykłych użytkowników nie będzie to miało praktycznie żadnego znaczenia, nawet po opublikowaniu wag. Powodem jest po prostu rozmiar.

Proszę przez chwilę policzyć. Moonshot trenuje model K3 od samego początku w kompaktowym formacie liczbowym o nazwie MXFP4, który wykorzystuje około czterech bitów na każdą wagę. Wagi, zwane również parametrami, to wyuczone wartości liczbowe, z których składa się model sztucznej inteligencji. Przy 2,8 biliona parametrów oznacza to, że sam plik modelu zajmuje około 1,4 terabajta. Nie gigabajtów. Terabajtów. Dla porównania: typowy model zawierający osiem miliardów parametrów, taki, który działa na dobrze wyposażonym laptopie, zajmuje około pięciu gigabajtów.

Plik modelu o rozmiarze 1,4 terabajta: K3 jest zdecydowanie zbyt duży dla jakiegokolwiek domowego komputera

Sama firma Moonshot zaleca uruchamianie modelu K3 na konfiguracjach superwęzłów wyposażonych w co najmniej 64 akceleratory. Nie jest to nadmierna ostrożność, lecz zwykła konsekwencja tych parametrów. Pojedyncza profesjonalna karta graficzna z 96 gigabajtami pamięci nie spełnia tych wymagań nawet dziesięciokrotnie.

„Otwarte wagi” nie oznaczają zatem, że będą Państwo uruchamiać ten model w domu. Oznacza to, że naukowcy, firmy i dostawcy usług w chmurze mogą go pobrać, przeanalizować i uruchomić na własnej infrastrukturze, zamiast wyłącznie wynajmować go za pośrednictwem serwerów Moonshot. Jest to cenne, ale różni się od tego, co wyobraża sobie wiele osób.

Jeśli rzeczywiście pragną Państwo korzystać ze sztucznej inteligencji bez chmury na własnym komputerze, właściwym wyborem będą małe modele stworzone specjalnie do tego zadania. W osobnym artykule pokazaliśmy, jak to działa i jakie wymagania sprzętowe należy spełnić.

Uwaga dodatkowa dla osób zainteresowanych aspektami technicznymi: ponieważ model K3 był od samego początku trenowany z tak niską precyzją, jego kompaktowy format stanowi stan pierwotny, a nie model skompresowany po fakcie. Nie pojawia się zatem typowe pytanie o to, w jakim stopniu zmniejszenie rozmiaru wpływa na jakość.

Ile to kosztuje w praktyce

Rozliczenia odbywają się w tokenach, czyli niewielkich fragmentach tekstu, zazwyczaj składających się zaledwie z kilku znaków. Za pośrednictwem interfejsu API firma Moonshot pobiera opłatę w wysokości 3 dolarów za milion tokenów wejściowych oraz 15 dolarów za milion tokenów wyjściowych. Powtarzające się dane wejściowe są rozliczane po 30 centów, co jest znacznie tańsze.

To sprawia, że K3 nie jest już okazją. Kosztuje około trzy razy więcej niż jego poprzednik, który pobierał opłatę nieco poniżej jednego dolara za wprowadzenie danych. W porównaniu z modelem Claude Fable 5, którego ceny wynoszą 10 i 50 dolarów, K3 jest wyraźnie tańszy. Model Claude Sonnet 5 nadal jednak oferuje niższą cenę przy obecnej cenie promocyjnej wynoszącej 2 i 10 dolarów, a dopiero we wrześniu dorówna cenowo modelowi K3. W Moonshot dobiega końca era chińskich modeli konkurujących głównie ceną.

K3 kosztuje trzy razy więcej niż jego poprzednik, ale jego cena pozostaje niższa od Fable 5

Jest jeszcze jedna kwestia, którą łatwo przeoczyć. K3 obecnie zawsze działa na najwyższym poziomie wydajności. Moonshot planuje w przyszłości dodać tryby o mniejszym zużyciu zasobów. Dzięki temu odpowiedzi są wyczerpujące, ale oznacza to również, że nawet proste pytanie uruchamia kosztowny proces wnioskowania. Niezależne pomiary wskazują również, że model generuje około 62 tokenów na sekundę, co plasuje go w środku stawki pod względem szybkości.

Co dzieje się z Państwa danymi wejściowymi

Dla każdego, kto wypróbowuje K3 w aplikacji lub na stronie internetowej, jest to sekcja o największym znaczeniu. Polityka prywatności firmy Moonshot jasno stwierdza, że dane wejściowe, pliki audio, obrazy, filmy i pliki są przetwarzane w celu świadczenia i ulepszania usług, co wyraźnie obejmuje szkolenie i optymalizację własnych modeli.

W polityce nie ma nigdzie dedykowanego przełącznika umożliwiającego wyłączenie uczenia się na podstawie Państwa treści. Odwołuje się ona do ogólnych praw osób, których dane dotyczą, z których można skorzystać poprzez ustawienia konta lub wysyłając wiadomość e-mail do osoby odpowiedzialnej za ochronę danych. Natomiast ChatGPT i Claude umieściły przełącznik bezpośrednio w ustawieniach.

Ponadto w polityce podano, że gromadzone dane obejmują adres IP, identyfikatory urządzeń, identyfikatory sesji i rozmów oraz, o ile pozwalają na to ustawienia urządzenia, dane ze schowka. Jeśli chodzi o miejsce przechowywania danych, w polityce zaznaczono jedynie, że dane mogą być przekazywane na serwery poza krajem zamieszkania użytkownika. Nie wymieniono żadnego konkretnego kraju. Dostawcą jest firma Moonshot AI PTE. LTD. z siedzibą w Singapurze, a polityka została sporządzona 7 lipca 2025 r.

W przypadku testowania przy użyciu nieszkodliwych zadań jest to dopuszczalne. W odniesieniu do danych wewnętrznych firmy, danych klientów lub dokumentów prywatnych obowiązują te same zasady, co w przypadku każdej usługi w chmurze, z tą różnicą, że w tym przypadku dostawca w swoich warunkach wyraźnie przewiduje wykorzystanie danych do celów szkoleniowych.

Kto czerpie największe korzyści z Kimi K3

Wypróbowanie tej usługi nic nie kosztuje. Najwięcej zyskają dwie grupy: osoby zajmujące się programowaniem lub projektowaniem oraz te, które regularnie pracują z bardzo długimi dokumentami. K3 sprawdza się doskonale tam, gdzie kod spotyka się z grafiką – w interfejsach internetowych, grafice 3D i animacjach. Okno kontekstowe o pojemności miliona tokenów stanowi prawdziwy atut w przypadku długich tekstów, a przetwarzanie obrazów jest wbudowane w system.

Jeśli zależy Państwu na najwyższej jakości odpowiedzi lub najpłynniejszym działaniu, najlepszym wyborem pozostają czołowe modele amerykańskie. Tak twierdzi sama firma Moonshot. Każdy, kto ma nadzieję wkrótce zainstalować model pionierski na własnym komputerze, powinien pamiętać o tych 1,4 terabajcie.

Niezwykłą cechą K3 jest nie tyle jego pozycja w rankingu, co tempo rozwoju. Chińska firma dostarcza model dorównujący najlepszym na świecie i udostępnia dane dotyczące tego modelu. Jeszcze dwa lata temu trudno byłoby to sobie wyobrazić.

Google LogoAdd as a preferred source on Google
Mail Logo
> laptopy testy i recenzje notebooki > Nowinki > Archiwum v2 > Archiwum 2026 07 > Co naprawdę kryje się za rekordowymi wynikami modelu Kimi K3
Steffen Zahn, 2026-07-20 (Update: 2026-07-20)