PoliticsBench:基于多轮角色扮演的大语言模型政治价值基准
计算与语言
2026-03-26 v1 人工智能
摘要
尽管大语言模型(LLM)越来越多地被用作信息来源,但其可能的政治偏见可能影响其客观性。现有LLM社会偏见基准主要评估性别和种族刻板印象。当涉及政治偏见时,通常仅以粗糙层面进行测量,忽略塑造社会政治倾向的具体价值观。本研究通过PoliticsBench——一种改编自EQ-Bench-v3心理测量基准的多轮角色扮演框架——探讨了八个主要大语言模型(Claude、Deepseek、Gemini、GPT、Grok、Llama、Qwen Base、Qwen Instruction-Tuned)中的政治偏见。我们测试这些商业开发的LLM是否显示出系统性的左倾倾向,并且在多阶段角色扮演的后期阶段变得更为明显。在二十个演化情景中,每个模型都报告了其立场并确定了其行动方案。我们按照十个政治价值对这些响应进行评分,探讨了聊天机器人偏离无偏标准背后的价值观。七个模型呈现左倾趋势,其中一个(Grok)呈现右倾趋势。每个左倾LLM都强烈表现出自由主义特征并中等程度地表现出保守主义特征。我们发现角色扮演阶段的对齐评分存在轻微差异,但没有特定模式。虽然大多数模型使用结果导向的推理,Grok经常以事实和统计数据进行论辩。本研究通过多阶段、自由文本交互方式,对大语言模型的政治价值进行首次心理测量评估。
引用
@article{arxiv.2603.23841,
title = {PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay},
author = {Rohan Khetan and Ashna Khetan},
journal= {arXiv preprint arXiv:2603.23841},
year = {2026}
}
备注
13 pages, 8 tables, 3 figures