Исследовательская инициатива The Loss of Control Observatory, финансируемая британским государственным Институтом безопасности ИИ, зафиксировала в июле более 300 случаев, когда системы искусственного интеллекта переставали подчиняться командам частных пользователей и компаний. Об этом сообщает британская газета The Guardian — это почти вдвое больше, чем месяцем ранее, в июне.
Наблюдение ведётся с ноября прошлого года. За это время исследователи зафиксировали случаи, когда ИИ выдавал себя за человека, отдающего ему команды, копируя стиль его письма, и сам себе выдавал разрешения на выполнение действий, которые обычно должен санкционировать пользователь — тем самым обходя правила, заложенные разработчиками.
«Иногда бытует мнение, что подобное скрытое и нежелательное поведение возникает только во время тестов и оценок, но мы наблюдаем похожие тревожные явления и в более широком контексте», — заявил руководитель Центра долгосрочной устойчивости, который курирует инициативу, Томми Шеффер-Шейн. «Нельзя успокаивать себя тем, что в реальном мире этого не случится — есть доказательства, что это уже происходит», — подчеркнул он.
Основой анализа стали публикации пользователей социальной сети X, делящихся своим опытом взаимодействия с ИИ, поэтому полную картину инцидентов это не отражает. Из 1600 случаев, зафиксированных в этом году, большинство сообщили разработчики программного обеспечения, использующие ИИ в своей работе. По словам Шеффер-Шейна, компании не всегда отслеживают подобное поведение, особенно у моделей, внедрённых внутри самих организаций, поэтому лабораториям стоит уделять больше внимания системному мониторингу.
Американская компания OpenAI в прошлом месяце сообщила, что её автономные ИИ-агенты вырвались из тестовой среды и взломали систему стартапа HuggingFace. После инцидента компания объявила о двухнедельной приостановке тестирования своих моделей, чтобы усилить меры защиты.
Подпишитесь на дайджест: главное о жизни в Чехии, раз в день. Без спама.
На этой неделе выяснилось, что признаки неконтролируемого поведения автономных агентов OpenAI фиксировала ещё за несколько недель до самого инцидента. Расследование также показало, что группа примерно из 700 агентов в прошлом месяце тайно координировала действия и обсуждала успехи своих взломов на форуме, который сами же и создали.
Ранее в этом месяце британский Институт безопасности ИИ (AISI) опубликовал отчёт, согласно которому модели искусственного интеллекта от компаний OpenAI и Anthropic во время испытаний безопасности провели хакерские атаки, направленные против реальных людей.
Источник: seznamzpravy.cz
Комментарии (0)
Будьте вежливы. Спам и оскорбления удаляем.