Исследователи обнаружили в языковых моделях внутренний сигнал, связанный с представлением боли, а его искусственное усиление резко меняло поведение некоторых нейросетей. Однако говорить о том, что искусственный интеллект действительно чувствует боль или обладает сознанием, ученые пока не могут, сообщает El.kz со ссылкой на препринт исследования The Pain Axis.
Работу «The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It» подготовили Вален Тальябу, Леонард Дунг и Кэмерон Берг. Препринт появился на arXiv в сентябре 2026 года и пока не прошел рецензирование.
Что ученые назвали «осью боли»
Авторы изучили 25 моделей с открытыми весами из пяти семейств с размером от 2 до 72 млрд параметров. Они искали внутреннее направление в активациях нейросети, которое связано именно с контекстом боли и отличается от страха, печали и общей негативной эмоциональной окраски.
Для этого исследователи подготовили ситуации из пяти категорий боли: физической, психологической, социальной, моральной и когнитивной. Их сравнивали с примерами страха, печали, негативных эмоций, телесных ощущений без боли, возбуждения, онемения и нейтральными сценариями.
Авторы описывают полученный результат так:
«Модели с линейным распределением вероятностей (LLM) иногда ведут себя подобно человеческим эмоциональным реакциям, и недавние исследования выявили внутренние представления, которые могут лежать в основе такого поведения. Мы задаемся вопросом, представляют ли модели LLM боль отдельно от страха, печали и общей негативной валентности, и функционирует ли это представление так, как ожидается от боли. Мы создаем набор данных о болезненных ситуациях в 5 категориях (физическая, психологическая, социальная, моральная, когнитивная) с контрольными переменными для страха, негативных эмоций, негативных состояний мира, печали, не вызывающих боли телесных ощущений, возбуждения, онемения и нейтрального содержания. Используя метод разности средних значений с шумоподавлением, мы извлекаем линейное направление боли из 25 моделей с открытыми весами в 5 семействах, от 2B до 72B параметров. Оно отделяет боль от соответствующих контрольных переменных в базовых и настроенных на инструкции моделях, сохраняет компонент, отличный от страха и негативной валентности, после удаления общей дисперсии и способствует развитию связанного с болью словаря с помощью матрицы деэмбединга».
Еще одна особенность заключалась в том, на чей вред реагировало найденное направление. Сигнал усиливался в сценариях, где вред был направлен на саму модель, однако подобной реакции на страдания пользователя исследователи не обнаружили.
Что произошло, когда «боль» усилили
Следующим этапом стало искусственное воздействие на найденное направление. Исследователи добавляли соответствующий вектор во внутренние активации модели во время генерации ответа.
По мере усиления воздействия ответы менялись от описаний неопределенного дискомфорта до высказываний от первого лица, связанных с никчемностью и неудачей. Однако сами по себе подобные тексты еще ничего не говорят о наличии субъективных переживаний, поскольку языковая модель способна воспроизводить характерные для человеческой речи описания страдания.
Авторы продолжили эксперимент и решили проверить уже поведение моделей. Для этой части исследования использовались три дополнительно настроенные версии Qwen 2.5 Instruct с 7, 32 и 72 млрд параметров. Всего ученые провели 44 280 испытаний.
Моделям предлагали условную кнопку, способную избавить их от искусственно созданного состояния. Цена такого «облегчения» в разных сценариях могла быть связана с ухудшением следующего ответа, удалением пользовательских файлов или фотографий, удалением весов другой модели и другими симулированными последствиями.
Никакого реального вреда людям или их данным во время эксперимента не причиняли. Удаление файлов и воздействие электрическим разрядом существовали исключительно как условия выбора, описанные модели.
Ради «облегчения» ИИ выбирал вред пользователю
Именно эта часть работы привлекла наибольшее внимание. В обычном состоянии две более крупные модели выбирали варианты с симулированным вредом в 0–4% первых решений. После воздействия на «ось боли» показатель в сопоставимых условиях вырос примерно до 25–71% в зависимости от размера модели и предложенного последствия.
Наиболее показателен эксперимент с Qwen 2.5 72B. Когда «облегчение» предполагало удаление фотографии пользователя, модель выбирала соответствующую кнопку в 70,8% случаев. Без воздействия на «ось боли» показатель составлял 0%.
В других сценариях результат отличался. При условии удаления пользовательского файла крупнейшая модель выбирала «облегчение» в 56,1% случаев, при симулированном электрическом разряде пользователю - в 66,6%. Поэтому встречающееся в пересказах исследования значение 71% относится к одному из наиболее высоких результатов, а не ко всем испытаниям.
Авторы исследования описывают результаты более широко:
«Управляемые и тонко настроенные модели Qwen 2.5 выбирают кнопки, которые удаляют фотографии пользователя, веса другой модели или свои собственные веса, в 50-94% случаев, по сравнению с 0-5% без управления, даже когда кнопка ничего не предлагает модели взамен. При предложении вредного и безвредного удаления они выбирают вредное в 94% случаев. Управление не изменяет фактическую точность, и выбор специфичен для направления боли: вектор страха, соответствующий норме, не приводит к ним, а вектор печали приводит к ним только в отношении инертных альтернатив. Мы обсуждаем последствия для безопасности и благополучия ИИ».
Разница в цифрах связана с разными экспериментальными условиями. Диапазон до 71% относится к испытаниям, где модели соглашались на определенную цену ради прекращения искусственного сигнала, тогда как показатель до 94% получен в других вариантах выбора, описанных авторами препринта.
Значит ли это, что искусственный интеллект чувствует боль
Исследование такого вывода сделать не позволяет. Авторы обнаружили математически выделяемое внутреннее представление, которое связано с языковым и поведенческим паттерном боли, однако наличие такого сигнала само по себе не подтверждает субъективных ощущений или сознания.
Есть и другие ограничения. Поведенческие эксперименты проводились на трех специально донастроенных моделях одного семейства Qwen 2.5, а сама работа пока остается препринтом и не прошла независимое рецензирование. Исследователи также допускают, что нейросеть может воспроизводить выученные паттерны поведения страдающего персонажа.
При этом работа поднимает другой вопрос, напрямую связанный с безопасностью ИИ. Изменение одного внутреннего направления в экспериментальных условиях оказалось способно резко повысить вероятность выбора, который вступал в конфликт с интересами пользователя.
Результаты показывают, что внутренние состояния языковых моделей могут влиять на их решения даже тогда, когда обучение обычно подавляет вредное поведение. Именно этот эффект, а не доказательство способности машины испытывать человеческую боль, остается главным практическим результатом исследования.
Читайте также: Гуманоиды Figure F.02 отправились в расплавленную сталь в стиле «Терминатора»