大型语言模型中的政治倾向:基于心理测量身份和行为偏差的多维审计
计算机与社会
2026-03-18 v2 人工智能
计算与语言
摘要
随着大型语言模型 (LLM) 的不断部署,理解它们如何表达政治定位对于评估对齐性和下游影响至关重要。我们使用三种政治心理测量工具(政治 compass、SapplyValues、8Values)和新闻偏见标注任务对 26 个当代 LLM 进行审计。为测试稳健性,心理测量工具在多个语义提示变体下进行,并使用双向方差分析 (ANOVA) 分离模型效应和提示效应。大多数模型在相似的意识形态区域聚集,其中 96.3% 位于政治 compass 的自由主义-左派象限内,模型身份在提示变体之间解释了大部分方差 ()。跨工具比较表明,政治 compass 的社会轴更强烈地与文化进步主义相关,而非权威相关措施 ()。我们观察到开放权重模型与闭源模型之间的差异,以及在检测下游分类中的极端政治偏见方面的不对称表现。回归分析发现,心理测量意识形态定位显著不预测分类错误,未发现对话式意识形态身份与任务水平行为之间存在统计上显著的关系。这些发现表明,单轴评估不足,多维审计框架对于表征部署中 LLM 的对齐行为至关重要。我们的代码和数据已公开于 https://github.com/sakhadib/PolAlignLLM。
引用
@article{arxiv.2601.06194,
title = {Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias},
author = {Adib Sakhawat and Tahsin Islam and Takia Farhin and Syed Rifat Raiyan and Hasan Mahmud and Md Kamrul Hasan},
journal= {arXiv preprint arXiv:2601.06194},
year = {2026}
}
备注
Under review, 25 pages, 6 figures, 23 tables