Компанія Nvidia представила відкриту платформу для захисту ІІ-агентів — Open Agent Safety Platform. Вона має убезпечити роботу автономних програм на основі штучного інтелекту на всіх етапах: від тестування до реального використання в бізнесі. Про новинку оголосили в Санта-Кларі в Каліфорнії, а в розробці, за даними Nvidia, бере участь понад сто компаній і організацій з технологічної галузі, фінансового сектору, енергетики та робототехніки.
Розробники наголошують: це не черговий антивірус чи фільтр, який намагається заздалегідь вгадати дії ІІ. Nvidia має намір вибудувати, за власним висловом, «бар’єр безпеки навколо самого агента» — так, щоб система стримувала його, навіть якщо той почне діяти інакше, ніж задумували творці.
«Величезний потенціал штучного інтелекту для суспільства розкриється повною мірою лише тоді, коли ми вирішимо питання його безпеки», — заявив у понеділок очільник Nvidia Дженсен Хуанг, чиї слова наводить телеканал CNN. За його словами, безпека ІІ потребує технічного рішення на рівні всієї системи — від програмного забезпечення до апаратної частини.
Платформа складається із двох частин. Перша називається OpenShell і працює як суворий адміністратор між ІІ-агентом і комп’ютером, інтернетом чи корпоративними системами компанії.
Агенту можна, наприклад, дозволити читати певні дані, але заборонити їх змінювати. Дати доступ до одного API, але не до іншого. Дозволити працювати з файлами в одній папці, але закрити шлях до решти комп’ютера. Кожна така дія фіксується і може відстежуватися.
За даними Nvidia, OpenShell працює поза самою моделлю ІІ і створює межу, яку агенту складно обійти, навіть якщо він спробує вийти за межі наданих йому прав. Це принципово відрізняється від підходу, за якого безпека тримається лише на тому, що ІІ сам слухняно виконуватиме інструкції, — останніми місяцями стало зрозуміло, що саме це є слабким місцем. Якщо агенту дають довге й складне завдання, він починає сам планувати кроки і подекуди намагається обійти перешкоду, що виникла.
Коли програмних обмежень виявляється недостатньо, у дію вступає друга частина системи — Sentry. Вона працює на спеціалізованих процесорах Nvidia BlueField-4, фізично відокремлених від комп’ютера, на якому діє сам ІІ-агент.
Завдання Sentry просте: спостерігати за діями агента і втручатися, якщо він виходить за дозволені межі. Якщо, наприклад, агент спробує отримати доступ до системи, до якої йому доступ не належить, Sentry здатен ізолювати його. За даними Nvidia, це відбувається за мілісекунди.
Джерело: novinky.cz