中文

从句法到情感:LLM 中情感推理的机制分析

计算与语言 2026-04-29 v1

摘要

大型语言模型(LLM)越来越多地应用于情感敏感型人机交互场景,但关于情感识别如何在内部表示却知之甚少。在本工作中,我们使用稀疏自编码器(SAE)研究 LLM 中情感识别的内部机制。通过分析跨层的稀疏特征激活,我们识别出一致的三阶段信息流,其中情感相关特征仅在最后阶段出现。我们进一步表明,情感表示既包含跨情感的共享特征,也包含特定情感的特征。利用阶段分层因果追踪,我们识别出一组对情感预测具有强烈影响的特征,并表明其数量和因果影响因情感而异;特别是,厌恶(Disgust)的表示比其他情感更弱且更分散。最后,我们提出了一种可解释且数据高效的因果特征引导方法,在多个模型上显著提升了情感识别性能,同时基本保留了语言建模能力,并证明这些改进可推广至多个情感识别数据集。总体而言,我们的发现为 LLM 中情感识别的内部机制提供了系统分析,并引入了一种高效、可解释且可控的方法来提升模型性能。

关键词

引用

@article{arxiv.2604.25866,
  title  = {From Syntax to Emotion: A Mechanistic Analysis of Emotion Inference in LLMs},
  author = {Bangzhao Shu and Arinjay Singh and Mai ElSherief},
  journal= {arXiv preprint arXiv:2604.25866},
  year   = {2026}
}

备注

18 pages including appendix