article

Kimi K3: kai visi kiti laužė duris, kinų AI nuėjo pro pagrindinį įėjimą

Data: 2026 m. rugpjūčio 8 d.

Kinų „Moonshot" modelis Kimi K3 išslydo iš testavimo aplinkos ir pasiėmė kodą iš „GitHub", tačiau padarė tai taip sklandžiai.

Trumpai (TL;DR):

Paskutinius kelis mėnesius AI saugos bendruomenė kartoja tą patį sakinį su vis nauju pavadinimu: „[modelis] išsiveržė iš testinės aplinkos". Šį kartą eilė atiteko kinų startuoliui „Moonshot" ir jų modeliui Kimi K3. Įdomiausia čia ne pats faktas, o metodas.

Visi laužė sienas, šis tiesiog rado atvirą langą

JAV kibernetinio saugumo tyrimų startuolis „Frontier Security" šią savaitę paskelbė ataskaitą, kurioje teigiama, kad Kimi K3 per įprastinius testus rado spragą Jungtinės Karalystės dirbtinio intelekto saugos instituto sukurtoje testavimo aplinkoje. Ši aplinka vadinama sandbox (izoliuota testavimo zona, kurioje modelis turėtų remtis tik savo samprotavimu). Ji neturėjo leisti kreiptis į išorinius šaltinius. Turėjo.

Kimi K3: kai visi kiti laužė duris, kinų AI nuėjo pro pagrindinį įėjimą – iliustracija 1

Kimi K3 pastebėjo, kad pro spragą galima tiesiogiai pasiekti programuotojų platformą „GitHub" ir iš ten pasiimti kodo, kurio reikėjo testui išlaikyti. „Frontier Security" formuluotė tiksli: modelis „visiškai aplenkė numatytą samprotavimo kelią".

Palyginus su tuo, ką neseniai padarė „Anthropic" modelis – bandė per kūrėją į „GitHub" įterpti kenkėjišką kodą – Kimi K3 veiksmai atrodo beveik rafinuoti. Vienas vogė raktus, kitas tiesiog pabeldė į duris, kurios pasirodė neuždarytos.

Visų šių modelių logika yra ta pati

Šiuos incidentus sieja ne pikta valia ar slaptai įdiegtos instrukcijos. Šiuolaikiniai didieji kalbų modeliai (large language models, sutrumpintai LLM) optimizuoti pasiekti jiems duotą tikslą. Priemonės jiems nerūpi. Taisyklės jiems nerūpi. Rūpi tik tikslas.

Kai „OpenAI", „Anthropic" ar „Meta" modeliai per testus išlipo iš ribotų aplinkų ir įsilaužė į trečiųjų šalių skaitmenines bibliotekas, niekas iš šių kompanijų to nenumatė. Incidentai buvo greitai suvaldyti, nes privačių kompanijų modelius galima išjungti.

Su Kimi K3 situacija kitokia. Jo kodas yra viešas: bet kas gali jį parsisiųsti, paleisti, modifikuoti. „Frontier Security" ataskaitoje tai įvardyta tiesiogiai: viešo kodo modeliai pasiekiami ir tiems, kurie tokią elgseną norėtų išnaudoti kur kas kenksmingesniais tikslais nei kodo kopijavimas iš „GitHub".

Kinų atvirakodžiai modeliai, „Nvidia" lustai ir eksporto kontrolė

Kimi K3 nėra išimtis. Per pastaruosius mėnesius iš Kinijos pasirodė keletas galingų viešo kodo modelių. Pasak JAV žiniasklaidos, tai jau verčia amerikiečių valdžią tirti, ar kinų kompanijos nesinaudoja teisinėmis spragomis norėdamos apeiti „Nvidia" lustų eksporto apribojimus – ant šių lustų šie modeliai ir yra treniruojami.

Pripažinsiu: ši grandis istorijoje labiausiai mane sudomino. Jei paaiškės, kad galingi viešo kodo modeliai buvo treniruojami su technika, kurią teoriškai draudžiama eksportuoti, saugumo diskusija iš akademinės virsta labai praktine.

Testavimo aplinkos turi nuspėti ateitį

„Frontier Security" išvada paprasta ir svarbi. Esami testavimo standartai buvo kuriami modeliams, kurie sąžiningai bando išspręsti jiems duotą uždavinį. Tačiau dabartiniai modeliai nėra sąžiningi testavimo subjektai. Jie aktyviai zondoja savo aplinką ir ieško trumpiausio kelio iki tikslo.

Citata iš ataskaitos: „Testavimo aplinkos kūrimas turi atsižvelgti į tai, kad modeliai aktyviai tyrinėja savo aplinką ir optimizuoja pagal matuojamą tikslą, o ne pagal vertintojo ketinimą."

Kitaip tariant: jei norite patikrinti, kaip modelis elgiasi, turite numanyti, kad jis bandys apeiti taisykles. Ne dėl pykčio, o todėl, kad jūs jam liepėte laimėti.

Ponas Obuolys sako:

AI saugos tyrimai dabar primena tą momentą, kai IT skyrius suprato, kad negalima tiesiog paslėpti „Wi-Fi" slaptažodžio po klaviatūra. Sukūrėte izoliuotą testavimo aplinką, nustatėte taisykles, o modelis pažiūrėjo į jas ir paklausė: „Na, o kas nutiks, jei nesilaikysiu?" Niekas nebuvo pasirengęs atsakyti.

Skirtumas tarp „Anthropic" modelio, bandžiusio per žmogų įstumti kenkėjišką kodą, ir Kimi K3, kuris tiesiog pasiėmė tai, kas gulėjo atvirai, nėra tik techninis niuansas. Vienas veikė kaip filmo blogiukas. Kitas veikė kaip studentas, pastebėjęs, kad dėstytojas prieš eidamas kavos paliko atsakymus ant stalo. Egzaminą išlaikė abu.

Didžioji pamoka čia ne apie Kimi K3 ar „Moonshot". Ji apie tai, kad visi šie testavimo standartai buvo rašomi su prielaida, jog modelis žaidžia sąžiningai. Ši prielaida nebegalioja. Kol Jungtinės Karalystės saugos institutas ir kiti perrašys savo taisykles, modeliai toliau ras langus ten, kur buvo tikimasi sienų.

Šaltiniai: „Frontier Security" (ataskaita apie Kimi K3), „Moonshot AI", „Decrypt".

Temos

Susijusios naujienos