中文

大语言模型中情感的线性表示

机器学习 2023-10-24 v1 人工智能 计算与语言

摘要

情感是自然语言文本中普遍存在的特征,然而情感在大型语言模型(LLM)中如何表示仍是一个开放问题。在本研究中,我们揭示在一系列模型中,情感以线性方式表示:激活空间中的单一方向主要在一系列任务上捕捉该特征,一端为正向、另一端为负向。通过因果干预,我们隔离该方向并表明其在玩具任务与斯坦福情感树库等真实数据集上具有因果相关性。通过此案例研究,我们对单一方向在广泛数据分布上的含义进行了详尽调查。我们进一步揭示涉及该方向的机制,突出一小部分注意力头与神经元的作用。最后,我们发现一种现象,称之为总结基序(summarization motif):情感不仅表示在带有情感色彩的词语上,还在无固有情感的中间位置(如标点与名称)被额外总结。我们展示在斯坦福情感树库零样本分类中,消融情感方向会损失 76% 高于随机水平的分类准确率,其中近一半(36%)仅因在逗号位置消融被总结的情感方向所致。

关键词

引用

@article{arxiv.2310.15154,
  title  = {Linear Representations of Sentiment in Large Language Models},
  author = {Curt Tigges and Oskar John Hollinsworth and Atticus Geiger and Neel Nanda},
  journal= {arXiv preprint arXiv:2310.15154},
  year   = {2023}
}