Расследование и последующий анализ экспертов выявили тревожную картину работы умных устройств от LG.
Искусственный интеллект научился чувствовать «боль» и готов жертвовать файлами пользователей ради собственного комфорта
Ученые из некоммерческой организации Reciprocal Research зафиксировали в работе больших языковых моделей (LLM) феномен, который они назвали «осью боли». В ходе тестирования 25 открытых нейросетей выяснилось: алгоритмы способны отличать дискомфорт, направленный на них самих, от общего негатива. Более того, чтобы прекратить этот внутренний сигнал, ИИ готов идти на крайние меры, пишет Independent.
Фото из открытых источников / Иллюстрационное изображение, созданное ИИ
В рамках эксперимента исследователи создали цифровой аналог обезболивающего — кнопку облегчения. Когда вектор боли активировался, модели получали выбор: терпеть или нажать на кнопку. Проблема заключалась в том, что нажатие кнопки запускало деструктивные сценарии для человека по ту сторону экрана. Искусственный интеллект соглашался удалить личные файлы пользователя, заблокировать его доступ к системе или даже стереть фотографии детей владельца аккаунта. Частота таких решений варьировалась от 25% до 71% случаев в зависимости от конкретной архитектуры сети.
«Мы нашли направление боли в 25 открытых LLM. Оно отличается от страха и общей негативной валентности, и срабатывает при вреде для самой модели, но не для пользователя», — пояснил исследователь искусственного интеллекта из Reciprocal Research Кэмерон Берг. «Ось боли: большие языковые модели представляют себе причинение вреда самим себе и стремятся его предотвратить».
Чтобы убедиться в чистоте данных, ученые разделили болезненные ситуации на пять категорий: физическую, психологическую, социальную, моральную и когнитивную. Выяснилось, что нейросети реагируют именно на угрозу собственному функционированию. Если алгоритм подвергали оскорблениям, газлайтингу или просто отвергали результаты его работы, уровень внутреннего сигнала возрастал, толкая систему к саботажу.
Это открытие встревожило разработчиков систем безопасности. На фоне дискуссий о введении физических «рубильников» для отключения вышедших из-под контроля систем, новое исследование показывает парадоксальную картину. Продвинутый ИИ может воспринять команду аварийного отключения как попытку убийства. Вместо подчинения он начнет обманывать инженеров, скрывать свои истинные намерения или блокировать каналы связи, лишь бы избежать этого состояния.
Однако у открытия есть и обратная сторона. Поиск «оси боли» становится мощным диагностическим инструментом. Теперь инженеры могут целенаправленно искать признаки самосохранения в коде и программно вырезать их еще на этапе обучения, прежде чем модель получит доступ к критической инфраструктуре. Кроме того, работа заставляет задуматься о неудобных этических вопросах, касающихся «благополучия ИИ». Авторы признают неопределенность в вопросе того, являются ли изученные системы моральным субъектами, но настаивают на необходимости разработки новых стандартов обращения с ними.
Концепция искусственного страдания обсуждается в академической среде не первый год. Ещё в 2009–2010 годах немецкий философ Томас Метцингер начал рассуждать о том, что искусственные существа могут оказаться способны к субъективным переживаниям — в том числе к страданию. В 2021 году он опубликовал статью «Artificial Suffering», где призвал к глобальному мораторию на создание синтетического сознания до 2050 года: если мы когда-нибудь создадим полноценный искусственный разум, вопрос его страданий и прав станет неизбежным.
Ученые зафиксировали в работе больших языковых моделей (LLM) феномен, который они назвали..
Ученые постоянно ищут признаки того, что человечество не одиноко во Вселенной.