中文

大型语言模型中情感价值的非对称处理

计算与语言 2026-05-08 v1

摘要

机制可解释性已揭示了概念在大型语言模型(LLM)中的编码方式,但情感内容在机制层面仍鲜有了解。我们研究了LLM是否通过专门的内部结构或表层token匹配来处理情感价值。通过激活修补和引导技术,对开源LLM进行实验,发现负面和正面情感价值在不同网络深度处被处理。负面结果局限于早期层,而正面结果则在中后期层达到峰值。固定话题而改变情感价值方向,可产生情感价值的相反响应,从而排除了话题检测的可能。使用在所识别层次上确定的积极新闻方向进行引导,可将中性提示引向正面情感,表明这些层编码的情感价值可被操控。情感价值在LLM中是局部的、因果的且可被操控的,这使其成为可解释性监控的具体目标。

关键词

引用

@article{arxiv.2605.05653,
  title  = {Negative Before Positive: Asymmetric Valence Processing in Large Language Models},
  author = {Sohan Venkatesh},
  journal= {arXiv preprint arXiv:2605.05653},
  year   = {2026}
}