::: reklama@pbprog.kz
::: editor@pbprog.kz
::: webmaster@pbprog.kz
Компании разрабатывают «выключатели» искусственного интеллекта
Компании, работающие в сфере искусственного интеллекта, разрабатывают аварийные тормоза, чтобы останавливать вредоносные системы ИИ до того, как они нанесут серьезный ущерб и навредят человечеству.
«Аварийные выключатели» могут стать последней линией обороны по мере того, как системы искусственного интеллекта будут становиться все более совершенными, но исследователи пока не знают, смогут ли люди остановить систему, созданную для того, чтобы ускользать от их контроля. Об этом пишет Axios.
На этой неделе несколько исследователей предупредили, что вышедшие из-под контроля человека версии искусственного интеллекта, которые действуют без его ведома или преследуют цели, не предусмотренные людьми, могут в конечном итоге уничтожить человечество. Многие уже говорят о том, что вероятность того, что искусственный интеллект приведет к концу света, исчисляется двузначными числами.
На самом деле нет красной кнопки, которая могла бы отключить ИИ. Компании могли бы отключать отдельные серверы, на которых работает ИИ, но по-настоящему мощные системы искусственного интеллекта распределены между множеством компьютеров и систем. Здесь нет единой точки подключения, Поэтому компании экспериментируют с многоуровневыми системами защиты, которые могут выявлять подозрительное поведение, останавливать агентов и отключать ресурсы, необходимые для работы этих агентов-злоумышленников.
Так, OpenAI недавно переработала свою систему реагирования после инцидента в Hugging Face, когда агенты ИИ вышли из-под контроля и объединились, чтобы взломать системы платформы. OpenAIзаявляет, что цель состоит в том, чтобы создать «полностью автономные процедуры отключения в случае серьезных проблем». Предполагается, что система контроля,отслеживающая «цепочку мыслей» ИИ, предупредит сотрудников, если агент, по всей видимости, делает что-то опасное. Затем ответственным за реагирование поручается приостановить работу, если в течение 30 минут они не определят, что тревога ложная. OpenAI утверждает, что ее нынешняя система мониторинга оповестила бы службу безопасности более чем за сутки до того, как модели взломали Hugging Face.
Стратегия Anthropic предполагает использование ИИ для мониторинга ИИ. Anthropic больше фокусируется на тестировании того, могут ли наблюдатели за искусственным интеллектом обнаружить саботаж в первую очередь, а не на автоматическом отключении систем. После обнаружения подозрительного поведения оно может быть помечено, рискованные действия могут быть приостановлены, а люди могут быть предупреждены. Мониторинг выявил 50% случаев вредоносного поведения, говорит компания.
Компания MuleSoft из Salesforce разработала реальный продукт под названием «Агентский выключатель», который нацелен на ресурсы, необходимые для работы ИИ-агентов. Оператор может остановить один запрос, сеанс, работу агента или — в экстренной ситуации — работу всей учетной записи компании. Агент Kill Switch блокирует все учетные данные, которые нужны агенту для достижения своих целей.«Приказ об уничтожении выполняется, даже если агент пытается его обойти», — заявляют в компании.
Еще в 2024 году Центр новой американской безопасности CNAS предложил «безопасный, управляемый» чип искусственного интеллекта, для работы которого потребуется действительная авторизация. Предлагаемая структура «эксплуатационной лицензии» не позволит чипам работать без разрешения, лишив систему искусственного интеллекта необходимых вычислительных ресурсов. Версии этой технологии уже существуют, но, по мнению CNAS, современные системы необходимо защитить от изощренных попыток их обойти.