中文

穿越表面:探究大型语言模型的意识形态深度

计算与语言 2025-11-17 v2

摘要

大型语言模型(LLMs)显示出可识别的政治倾向,但在代表政治方向的能力上存在显著差异。本文定义意识形态深度为:(i)模型在不失败的情况下遵循政治指令的能力(可引导性),和(ii)其内部政治表示的特征丰富度,通过稀疏自动编码器(SAEs)测量,SAEs是一种无监督稀疏字典学习(SDL)方法。使用Llama-3.1-8B-Instruct和Gemma-2-9B-IT作为候选模型,我们比较基于提示的和激活引导的干预方法,并通过公开可用的SAEs探测政治特征。我们发现大量系统差异:Gemma在两个方向上都更具可引导性,并且激活约7.3倍的不同政治特征。此外,对Gemma一小组针对性政治特征的因果消除以创建类似缺乏特征的设置,会导致行为一致的变化,导致在各个主题上的拒绝率增加。总的来说,这些结果表明,对于善意的政治指令或提示,拒绝可能源于能力缺陷而非安全防护。意识形态深度因此作为LLMs的可衡量属性,具有可引导性作为其潜在政治架构的窗口。

关键词

引用

@article{arxiv.2508.21448,
  title  = {Beyond the Surface: Probing the Ideological Depth of Large Language Models},
  author = {Shariar Kabir and Kevin Esterling and Yue Dong},
  journal= {arXiv preprint arXiv:2508.21448},
  year   = {2025}
}