中文

大语言模型情感推断的机制可解释性

计算与语言 2025-07-01 v2 人工智能

摘要

大语言模型(LLMs)在从文本中预测人类情感方面显示出前景广阔的能力,但这些模型处理情感刺激的机制仍鲜有探索。我们的研究通过了调查自回归LLMs如何推断情感,表明情感表征功能性地局限于模型的特定区域。我们的评估包括多样的模型家族和规模,并得到了鲁棒性检查的支持。我们随后通过援引认知评估理论——一种旨在表明情感从对环境刺激的评估(评估)中产生的心理学框架——表明识别的表征是心理上合理的。通过对建构性评估概念进行因果干预,我们引导生成过程,表明输出与理论和直观期望一致。这项工作突显了一种新型的因果干预和精确塑造情感文本生成的方法,可能有助于在敏感情感领域的安全性和对齐方面的应用。

关键词

引用

@article{arxiv.2502.05489,
  title  = {Mechanistic Interpretability of Emotion Inference in Large Language Models},
  author = {Ala N. Tak and Amin Banayeeanzade and Anahita Bolourani and Mina Kian and Robin Jia and Jonathan Gratch},
  journal= {arXiv preprint arXiv:2502.05489},
  year   = {2025}
}

备注

ACL 2025 camera-ready version. First two authors contributed equally