中文

大型语言模型中涌现的政治视角线性表示

计算与语言 2025-04-03 v2 人工智能 计算机与社会 人机交互 机器学习

摘要

大型语言模型(LLMs)已展现出生成能够真实反映各种不同主观人类视角的文本的能力。本文研究 LLMs 如何似乎能够在众多政治视角中,反映出美国政治中更偏自由派与更偏保守派的观点。我们表明,LLMs 在激活空间内具有政治视角的线性表示,其中更相似的视角在表示上距离更近。为此,我们探测了三个基于 Transformer 的开源 LLMs(Llama-2-7b-chat、Mistral-7b-instruct、Vicuna-7b)各层的注意力头。我们首先提示模型从不同美国议员的视角生成文本。随后,我们识别出其激活值能线性预测这些议员 DW-NOMINATE 分数的注意力头集合,DW-NOMINATE 是一种广泛使用且经过验证的政治意识形态度量标准。我们发现,具有高度预测性的注意力头主要位于中间层,这些层通常被推测用于编码高层概念与任务。仅使用训练用于预测议员意识形态的探针,我们随后证明,相同的探针可以根据被提示模拟这些新闻机构文本的模型的激活值,预测新闻机构的倾向性度量。这些线性探针使我们能够可视化、解释并监控 LLM 在生成开放式回答时隐含采纳的意识形态立场。最后,我们证明,通过对这些注意力头应用线性干预,我们可以将模型输出引导至更偏自由派或保守派的立场。总体而言,我们的研究表明,LLMs 具有美国政治意识形态的高层线性表示,并且通过利用机制可解释性的最新进展,我们能够识别、监控并引导生成文本背后的主观视角。

关键词

引用

@article{arxiv.2503.02080,
  title  = {Linear Representations of Political Perspective Emerge in Large Language Models},
  author = {Junsol Kim and James Evans and Aaron Schein},
  journal= {arXiv preprint arXiv:2503.02080},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025 https://openreview.net/forum?id=rwqShzb9li