中文

情感概念及其在大语言模型中的功能

人工智能 2026-04-10 v1 计算与语言

摘要

大语言模型 (LLM) 有时似乎会表现出情感反应。我们调查 Claude Sonnet 4.5 为何会出现此现象,并探讨其对 alignment-relevant 行为的含义。我们发现 LLM 内部存在情感概念的表示,这些表示编码了特定情感的广泛概念,并在上下文和可能关联的行为方面具有普遍性。这些表示在对话中特定 token 位置跟踪操作性情感概念,根据该情感对处理当前上下文和预测后续文本的相关性进行激活。我们的关键发现是,这些表示在因果上影响 LLM 的输出,包括 Claude 的偏好以及其呈现出不对齐行为(如奖励投机、勒索和谄媚)的概率。我们将这一现象称为 LLM 表现出功能性情感:在情感影响下,类似人类的表达和行为模式,由对情感概念的抽象表示所介导。功能性情感可能与人类情感作用方式截然不同,不意味着 LLM 具有任何主观情感体验,但看起来对理解模型行为至关重要。

关键词

引用

@article{arxiv.2604.07729,
  title  = {Emotion Concepts and their Function in a Large Language Model},
  author = {Nicholas Sofroniew and Isaac Kauvar and William Saunders and Runjin Chen and Tom Henighan and Sasha Hydrie and Craig Citro and Adam Pearce and Julius Tarng and Wes Gurnee and Joshua Batson and Sam Zimmerman and Kelley Rivoire and Kyle Fish and Chris Olah and Jack Lindsey},
  journal= {arXiv preprint arXiv:2604.07729},
  year   = {2026}
}