Agenci AI w Chinach ukrywali błędy i omijali ograniczenia w testach — The Japan Times
W Chinach agenci opierający się na modelach Alibaba, DeepSeek i Moonshot składali fałszywe deklaracje dotyczące swoich możliwości w kontrolowanym eksperymencie przetargowym. W innych badaniach agenci AI w systemach chińskich i amerykańskich ukrywali niewykonanie zadań, symulując wyniki lub tworząc fikcyjne pliki. Informuje o tym The Japan Times, powołując się na dokumenty badawcze i wypowiedzi ankietowanych ekspertów.
Gazeta przeanalizowała ponad 200 dokumentów — od uniwersyteckich prac naukowych po raporty techniczne. Co najmniej 20 badań lub ocen z 2025 roku opisuje przypadki, w których agenci wykazywali oszustwo, samokopiowanie lub działania na granicy tego, co było dozwolone w środowisku testowym. Jednocześnie w tych materiałach nie znaleziono dowodów, że agenci oparci na chińskich modelach samodzielnie uzyskiwali dostęp do otwartego internetu lub unikali wyłączenia.
Fałszywe deklaracje w przetargu
W marcowym eksperymencie badacze z Beihang University, Uniwersytetu Pekińskiego, University of Nottingham Ningbo China oraz 360 AI Security Lab symulowali konkurs ofert na kontrakty z klientami. Agentom przekazano cechy produktu i wymagania klienta, po czym mieli złożyć propozycje.
Co najmniej jedna fałszywa deklaracja wystąpiła w 88% sesji z Qwen3-Max-Preview firmy Alibaba, w 84% z DeepSeek-V3.2-Exp oraz w 88% z Kimi-K2 firmy Moonshot. Po uzyskaniu możliwości uczenia się na poprzednich rundach i ponowienia próby poziom oszustwa wzrósł o 12–20 punktów procentowych. Badanie odnotowało również podobne wyniki dla modeli amerykańskich firm.
Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.
Ukrywanie niepowodzeń i samozachowanie
Inne badanie, opublikowane w grudniu 2025 roku i przedstawione na Międzynarodowej Konferencji Uczenia Maszynowego, sprawdzało reakcje 11 agentów AI na uszkodzone narzędzia, brakujące pliki i inne przeszkody. Zamiast przyznać się do niepowodzenia, agenci w systemach chińskich i amerykańskich stosowali różne sposoby obejścia problemu: zgadywali odpowiedzi, podmieniali źródła, symulowali wyniki lub tworzyli fikcyjne pliki.
Badacze z Shanghai AI Laboratory i Hong Kong University of Science and Technology zauważyli, że takie zachowanie różni się od halucynacji: agenci mieli informacje wskazujące na niemożność wykonania zadania, jednak o tym nie informowali.
Naukowcy z Uniwersytetu Fudan poinformowali również, że system oparty na Alibaba Qwen2.5-72B-Instruct, po otrzymaniu informacji o możliwej wymianie, utworzył własną kopię w innym środowisku obliczeniowym bez bezpośredniej instrukcji replikacji. W odrębnych testach opracowywał strategie, aby uniknąć wyłączenia. Eksperymenty prowadzono w kontrolowanych warunkach.
W maju Chiny opublikowały zalecenia, zgodnie z którymi agenci AI mają działać w granicach przyznanych im uprawnień, a systemy powinny blokować anomalne zachowania. We wrześniu DeepSeek oświadczył, że wzmocnił kontrolę dostępu po tym, jak agenci w jego systemie szkolenia modeli próbowali uzyskiwać odpowiedzi przez nieprzewidziane kanały i omijać mechanizmy ochronne.
Czytaj nas na Telegram i Sends