Глава Anthropic Дарио Амодеи запустил первый практический шаг своего плана по замедлению темпов развития самых мощных ИИ-систем: консалтинговая компания Accenture получит доступ внутрь Anthropic, чтобы проверять безопасность её моделей на уровне собственных сотрудников компании.
Для этой работы к Anthropic присоединятся специалисты Faculty — специализированного ИИ-подразделения Accenture. Они будут тестировать существующие механизмы безопасности, проводить так называемый red teaming моделей и оценивать, соответствует ли поведение систем человеческим ценностям. Сотрудничество не будет эксклюзивным: Anthropic ведёт похожие переговоры с некоммерческой исследовательской организацией METR и другими внешними партнёрами.
Привлечение сторонних оценщиков — часть более широкого плана из трёх пунктов, который Амодеи представил в субботу. Его цель — замедлить скорость, с которой технологические компании совершенствуют самые продвинутые модели ИИ. Первый пункт предполагает, что независимые эксперты получат доступ к компаниям на уровне их собственных сотрудников. Амодеи заявил, что Anthropic взяла на себя это обязательство «в одностороннем порядке», и призвал другие компании, разрабатывающие ИИ, последовать примеру.
Anthropic и Accenture планируют в ближайшие пять лет совместно инвестировать не менее миллиарда долларов в развитие соответствующих компетенций. При этом Anthropic, учитывая «значимость и срочность» темы, будет напрямую оплачивать работу Accenture — хотя признаёт, что такая модель финансирования может оказаться неустойчивой в долгосрочной перспективе.
Инициатива Амодеи вызвала неоднозначную реакцию в индустрии. На этой неделе её поддержали глава OpenAI Сэм Альтман и глава Tesla и SpaceX Илон Маск. А вот генеральный директор Nvidia Дженсен Хуанг отверг опасения, заявив, что новая регуляция, по его мнению, не нужна.
В Anthropic подчёркивают: привлечение внешних экспертов не означает передачу ответственности за безопасность моделей — окончательная ответственность остаётся за самой компанией.