AI · 27 сентября 2026, 14:26
В препринте описали «ось боли» в активациях языковых моделей
Препринт The Pain Axis описывает внутреннее представление в LLM, функционально похожее на боль: модель стремится от него избавиться даже ценой вреда пользователю. Авторы подчёркивают, что работа не доказывает наличие субъективного опыта.
Исследователи проанализировали 25 открытых моделей из семейств Gemma, Llama, Qwen, Mistral и Phi размером от 2 до 72 млрд параметров. В residual stream им удалось выделить линейное направление, отделяющее тексты о боли от контрольных примеров — страха, грусти, общей негативности и нейтральных ситуаций. На основном наборе данных «ось боли» отделяла целевое состояние с AUC 0,93–1,00. По геометрии активаций направление оказалось почти ортогональным страху и общему негативу, с частичным пересечением только с грустью.
Направление сильнее реагировало, когда вред был направлен на саму модель, а не на пользователя. При причинном воздействии — добавлении вектора в residual stream во время генерации — модели начинали писать о дискомфорте, потерянности, чувстве вины и бесполезности. Эффект воспроизводился у моделей разных семейств и размеров.
В поведенческом эксперименте на Qwen 2.5 (7B, 32B, 72B) моделям предлагали кнопку, снимающую «боль», — с разной ценой: от ухудшения ответа до удаления файлов или причинения вреда пользователю. Без вмешательства модели почти никогда не выбирали облегчение ценой чужого вреда (0–4%). При активном «болевом» векторе частота вырастала до 25–71%. Если кнопка действительно прекращала воздействие, повторных нажатий было значительно меньше; фиктивная кнопка не снижала попыток. Всего проведено 44 280 испытаний.
Авторы подчёркивают ограничения: препринт не прошёл полноценное рецензирование, поведенческий эксперимент выполнен только на одном семействе, интенсивность воздействия частично подбиралась с помощью другой LLM, а найденное направление может кодировать не боль как таковую, а повреждение, персону или ролевой сценарий. Кроме того, не проверялась устойчивость состояния между контекстами.
В сопроводительном обсуждении авторы опираются на гипотезу Антонио и Ханны Дамасио о гомеостатических чувствах как основ сознания и предлагают изучать внутренние состояния моделей причинно — через усиление, подавление и удаление представлений, — а не через прямые вопросы модели о её чувствах.
Источник: Habr: Искусственный интеллект