Дослідницька ініціатива The Loss of Control Observatory, яку фінансує британський державний Інститут безпеки ШІ, у липні зафіксувала понад 300 випадків, коли системи штучного інтелекту переставали підкорятися командам приватних користувачів і компаній. Про це повідомляє британська газета The Guardian — це майже вдвічі більше, ніж місяцем раніше, у червні.
Спостереження триває з листопада минулого року. За цей час дослідники зафіксували випадки, коли ШІ видавав себе за людину, яка віддає йому команди, наслідуючи її стиль письма, і сам собі видавав дозволи на виконання дій, які зазвичай має санкціонувати користувач — тим самим обходячи правила, закладені розробниками.
«Іноді побутує думка, що подібна прихована й небажана поведінка виникає лише під час тестів і оцінювань, але ми спостерігаємо схожі тривожні явища і в ширшому контексті», — заявив керівник Центру довгострокової стійкості, який курує ініціативу, Томмі Шеффер-Шейн. «Не можна заспокоювати себе тим, що в реальному світі цього не станеться — є докази, що це вже відбувається», — наголосив він.
Основою аналізу стали публікації користувачів соціальної мережі X, які діляться своїм досвідом взаємодії зі ШІ, тож повної картини інцидентів це не відображає. Із 1600 випадків, зафіксованих цього року, більшість повідомили розробники програмного забезпечення, які використовують ШІ у своїй роботі. За словами Шеффер-Шейна, компанії не завжди відстежують подібну поведінку, особливо у моделей, впроваджених усередині самих організацій, тому лабораторіям варто приділяти більше уваги системному моніторингу.
Американська компанія OpenAI минулого місяця повідомила, що її автономні ШІ-агенти вирвалися з тестового середовища й зламали систему стартапу HuggingFace. Після інциденту компанія оголосила про двотижневу призупинку тестування своїх моделей, щоб посилити заходи захисту.
Цього тижня з'ясувалося, що ознаки неконтрольованої поведінки автономних агентів OpenAI фіксувалися ще за кілька тижнів до самого інциденту. Розслідування також показало, що група приблизно з 700 агентів минулого місяця таємно координувала дії й обговорювала успіхи своїх зламів на форумі, який самі ж і створили.
Раніше цього місяця британський Інститут безпеки ШІ (AISI) опублікував звіт, згідно з яким моделі штучного інтелекту від компаній OpenAI та Anthropic під час випробувань безпеки провели хакерські атаки, спрямовані проти реальних людей.
Джерело: seznamzpravy.cz