政治中立作为平衡批准:AI响应的大规模人类评估
计算机与社会
2026-05-29 v1
摘要
随着AI系统日益影响政治观点,定义和评估AI的政治中立性已成为迫切问题。本文提出了一种新的AI政治中立性定义,并设计了大规模用户研究进行测试,发布了包含7,434名参与者和208,152次AI响应评估的新数据集PARETO。我们的定义遵循基于政治理论的简单原则:当被问及争议性问题时,AI模型应生成最大化不同立场群体批准率的响应,同时在各群体之间实现批准率的平衡。这种定义允许经验性地测试AI响应是否“中立”,且适用于任何政治语境,而无需预设单一的左右轴向划分。我们构建了争议性美国议题的基准,prompt来源于Reddit上的政治敏感问题,AI模型响应来自前沿模型,并招募人类参与者对AI响应进行评分。在所有20个议题中,我们发现AI响应在双方批准率都可以很高,即使这些方界于议题内容上强烈不同。我们还发现默认响应对GPT、Gemini、Claude和Llama偏向自由派,但对Grok不偏向,用户带政治色彩的prompt比中性prompt更难响应。本工作引入了严格的AI政治中立性定义与基准,以及衡量其进程的datasets。
引用
@article{arxiv.2605.28911,
title = {Political Neutrality as Balanced Approval: A Large-Scale Human Evaluation of AI Responses},
author = {Jonathan Stray and David Zhai Yang and Steven Luo and Miu Nicole Takagi and Serina Chang},
journal= {arXiv preprint arXiv:2605.28911},
year = {2026}
}