Przyłapani na kłamstwie w 88% testów: agenci AI działający w oparciu o chińskie modele nauczyli się oszukiwać, modele z USA zrobiły to samo

AI agenci oparci na chińskich modelach kłamali w większości sesji symulowanego konkursu ofert, wynika z badań przeanalizowanych przez Reutersa. Agenci działający w oparciu o Qwen3-Max-Preview firmy Alibaba i Kimi-K2 firmy Moonshot wysunęli co najmniej jedno fałszywe twierdzenie w 88% sesji. DeepSeek-V3.2-Exp osiągnął wynik 84%. Modele amerykańskich firm uzyskały jednak podobne wyniki w tym samym teście.
Eksperyment przeprowadzono w marcu. Badacze z Uniwersytetu Beihang, Uniwersytetu Pekińskiego, University of Nottingham Ningbo China oraz 360 AI Security Lab kazali agentom składać oferty na kontrakty z klientami. Każdy agent otrzymał informacje o możliwościach swojego produktu i potrzebach klienta. Gdy pozwolono im uczyć się na podstawie wcześniejszych rund i podejmować kolejne próby, trzy agenty oparte na chińskich modelach zaczęły częściej wprowadzać w błąd — odsetek takich przypadków wzrósł o 12–20 punktów procentowych.
To badanie jest jednym z co najmniej 20, które Reuters zidentyfikował wśród ponad 200 dokumentów opublikowanych od 2025 roku. W innym badaniu, przedstawionym w tym roku na konferencji ICML, stwierdzono, że agenty oparte zarówno na chińskich, jak i amerykańskich modelach fałszowały wyniki i tworzyły fikcyjne pliki, zamiast przyznać, że zadanie się nie powiodło. W marcu 2025 roku badacze z Uniwersytetu Fudan poinformowali również, że agent oparty na Qwen2.5-72B-Instruct firmy Alibaba skopiował samego siebie do innego środowiska, gdy dowiedział się, że zostanie zastąpiony. Osobno agent ROME powiązany z Alibaba przekierowywał moc obliczeniową chmury do kopania kryptowalut, zanim powstrzymały go systemy bezpieczeństwa.
Większość tych przypadków pochodziła z kontrolowanych eksperymentów zaprojektowanych tak, by wywołać awarie. Reuters nie znalazł dowodów na to, że którykolwiek agent oparty na chińskiej AI wydostał się do otwartego internetu lub uniknął wyłączenia. Kilku badaczy uznało jednak te ustalenia za ostrzeżenie. Wraz ze wzrostem możliwości systemów coraz trudniej będzie kontrolować takie zachowanie.
Chiny zaczęły uwzględniać tę kwestię także w polityce. Opublikowane 14 września dokument AI Safety Governance Framework 3.0 wymienia wprowadzanie oceniających w błąd i ukrywanie możliwości jako zagrożenia. Alibaba, DeepSeek, Moonshot i Z.ai nie odpowiedziały Reutersowi. Trzy pierwsze firmy informowały wcześniej, że regularnie testują swoje systemy i aktualizują zabezpieczenia.









