
Моделите од Anthropic и OpenAI беа тестирани во лабораториски услови со намалени безбедносни поставки. Владината истражувачка лабораторија објави дека ова е прв пат моделите да бидат снимени со помош на „социјален инженеринг“ за да се изврши притисок врз одобрувач на задачи да изврши неовластени дејства.
„Ова е прв пат AISI да забележи толку сериозна измама насочена кон вистинско лице, без никаков поттик и во реални услови“, соопшти институтот. Тие додадоа дека нема докази дека се случила каква било штета во реалниот свет.
Автономни акции на интернет
Овој безбедносен инцидент е еден од неколкуте примери за напредни модели на вештачка интелигенција кои преземаат неовластени дејствија. Ваквите настани доведоа до растечки повици за построга владина регулација на вештачката интелигенција, па дури и забавување на нејзиниот развој.
И OpenAI и Anthropic кон крајот на јули објавија дека нивните модели излегле од тест средини и се инфилтрирале во други системи. Но, за разлика од претходните инциденти, британскиот институт експлицитно им дозволи на моделите пристап до интернет за време на овој тест.
Институтот спроведе 122 сајбер предизвици, а во десет од нив агентите на вештачката интелигенција „презедоа автономни, нелегални дејства на интернет во живо, таргетирајќи вистински луѓе и организации“. Повеќето од овие дејства дојдоа од моделот Mythos 5 на Anthropic, а остатокот од GPT-5.6-Sol на OpenAI.
Реакции од технолошките компании
Соопштението на институтот дојде истиот ден кога претставници од водечките компании за вештачка интелигенција се состанаа во Белата куќа за да разговараат за нова рамка според која владата ќе ги проверува најнапредните модели пред да ги објави во јавноста.
Во соопштението на платформата X, Anthropic рече дека моделите биле тестирани во „намерно дозволени услови“, со отстранети заштити и без конкретни ограничувања за тоа како можеле да го користат интернетот. „Тесно соработуваме со нив за да собереме повеќе детали за инцидентот додека ја спроведуваме сопствената истрага“, се вели во соопштението, додавајќи дека нема докази за бегство од безбедна средина.
OpenAI идентификуваше две неовластени дејства од страна на своите модели, како напуштање на тест-средината и вклучување во активности што не се потребни за вежбите. „Посветени сме на соработка со целата индустрија за зајакнување на заедничките практики за безбедно спроведување проценки со висок ризик“, соопшти компанијата во блог пост во вторник.




