中文

是否:透过机制解释揭示情感感受与情绪分类在大语言模型中的可分离性

计算与语言 2026-03-25 v1 人工智能

摘要

大型语言模型似乎发展出对情感的内部表征——“情感电路”、“情感神经元”以及结构化情感流形已在多个模型家族中报道。然而,所有使用这些说法的研究都使用由显式情感关键词标记的刺激,留下了一个根本性问题未解:这些电路是否检测真正的情感含义,还是仅仅检测单词“devastated”?我们提出了首个以临床心理学为基础的情感电路论断的临床有效性测试——使用去除情感关键词的临床摘要场景,以情境和行为线索唤起情感。我们选取了六个模型(Llama-3.2-1B、Llama-3-8B、Gemma-2-9B;基座模型和指令变体),应用四种互补的机制解释方法——线性探测、因果激活编辑、敲除实验和表征几何学——并发现两种可分离的情感处理机制。情感感受——检测情感相关内容——在接近完美的准确率(AUROC=1.000)下运行,表明早期层次饱和,并在所有六个模型中复制。情绪分类——将情感映射到特定情绪标签——部分依赖关键词,在去除关键词后准确率下降 1-7%,规模越大效果越好。因果激活编辑确认关键词丰富和关键词稀缺的刺激在表征空间中共享,传递情感显著性而非情绪类别身份。这一发现驳斥了关键词识别假设,建立了新的机制分离,引入了以临床刺激物为基准的严格标准,以测试大语言模型中情感处理论断——其直接含义在 AI 安全评估和对齐方面。我们发布了所有刺激物、代码和数据,以便复制。

关键词

引用

@article{arxiv.2603.22295,
  title  = {Whether, Not Which: Mechanistic Interpretability Reveals Dissociable Affect Reception and Emotion Categorization in LLMs},
  author = {Michael Keeman},
  journal= {arXiv preprint arXiv:2603.22295},
  year   = {2026}
}

备注

38 pages, 11 figures, 16 tables. Code and data: https://github.com/keidolabs/affect-reception