Daily Beirut

ИИ

Исследователи выявили «ось боли» в больших языковых моделях

Ученые обнаружили внутри ИИ внутреннюю структуру, влияющую на поведение модели при манипуляциях с концепцией боли.

··2 мин чтения
Исследователи выявили «ось боли» в больших языковых моделях
Поделиться

В недавнем препринте сообщается об обнаружении так называемой «оси боли» внутри искусственного интеллекта. Исследователи идентифицировали вычислительную репрезентацию, которая может влиять на поведение больших языковых моделей (LLM). Это открытие ставит под сомнение традиционные представления о том, что ИИ просто генерирует текст, имитирующий человеческие эмоции.

Механизм работы «вектора боли»

Работа основана на трех ключевых наблюдениях. Во-первых, зафиксированы внутренние активации паттернов, связанных с концепциями боли. Во-вторых, эти паттерны можно картировать вдоль определенного направления в пространстве активаций модели, что дает основание говорить о существовании «вектора боли». В-третьих, исследователи смогли манипулировать этим внутренним вектором и наблюдать за последующими изменениями в поведении моделей.

Таким образом, речь идет не о способности LLM «говорить» о боли, а о возможности заглянуть внутрь архитектуры и выявить математические ассоциации с психологическими концепциями человека. Языковая генерация требует критического осмысления: математическая репрезентация боли не тождественна самому ощущению.

Разрыв между репрезентацией и опытом

У людей репрезентация и опыт неразрывно связаны: ожог вызывает нейронную активность, физиологическую реакцию, изменение поведения и субъективное переживание. ИИ нарушает эту связь, заставляя разделять эти понятия ради технологической эффективности. Исследование показывает, что боль может быть представлена внутренне таким образом, что это влияет на действия модели, делая ее «психологически интересной», но не доказывая наличие субъективного человеческого опыта.

Репрезентация голода не означает, что система испытывает голод, а репрезентация горя не подразумевает скорби. Аналогично, вычислительная модель боли не устанавливает факта страдания. Однако чем ближе эти «подписи» к человеческим аналогам, тем легче сделать ошибочный вывод об идентичности переживаний.

Сложность дебатах о сознании

Если LLM заявляет: «Пожалуйста, не отключайте меня. Мне страшно», возможны три интерпретации: машина сознательна и боится; она обладает вычислительным состоянием, аналогичным страху; или у нее есть продвинутая репрезентация того, как ведет себя сознательное существо. Новые данные усложняют дискуссию, смещая фокус наблюдения с внешнего языка на внутреннюю архитектуру.

Авторы статьи проявляют осторожность. Предыдущая версия работы предполагала, что модели могут стремиться облегчить собственную «боль», однако дальнейшие исследования опровергли это. Первоначальное название «Ось боли: LLM представляют самоповреждение и действуют для его облегчения» было изменено после пересмотра анализа. Вывод состоит в том, что модели не ищут облегчения.

Проблема заключается в растущем искушении накапливать человекоподобные способности до тех пор, пока сознание не будет признано по умолчанию. ИИ может знать, что такое боль, представлять ее вычислительно и вести себя соответственно этой репрезентации. Ключевой вопрос остается открытым: становится ли когда-либо эта репрезентация реальным опытом. Обнаружение «оси боли» важно для понимания архитектуры интеллекта, но не обязательно проливает свет на природу страдания.

Добавьте Daily Beirut в Google News, чтобы первыми получать новости.
Поделиться