大语言模型中 Overton 多元主义的基准测试
人工智能
2026-03-03 v2
摘要
我们引入了 OVERTONBENCH,一个用于测量大语言模型(LLMs)中 Overton 多元主义的新框架——即模型输出中代表多元观点的程度。我们(i)将 Overton 多元主义形式化为集合覆盖度量(OVERTONSCORE),(ii)开展大规模美国代表性人类研究(N = 1208;60 个问题;8 个 LLM),(iii)开发了一个自动化基准测试 closely 复现人类判断。平均而言,模型的 OVERTONSCORE 为 0.35–0.41,DeepSeek V3 表现最佳;然而所有模型仍远低于理论最大值 1.0,揭示了显著的改进空间。由于反复进行大规模人类研究成本高昂且耗时,可扩展的评估工具对于模型开发至关重要。因此,我们提出了一种自动化基准测试,与人类判断实现了高秩相关性(ρ = 0.88),提供了一个实用的代理指标而无需替代人类评估。通过将多元对齐从规范性目标转变为可测量的基准,我们的工作为系统性地迈向更具多元主义的大语言模型奠定了基础。
引用
@article{arxiv.2512.01351,
title = {Benchmarking Overton Pluralism in LLMs},
author = {Elinor Poole-Dayan and Jiayi Wu and Taylor Sorensen and Jiaxin Pei and Michiel A. Bakker},
journal= {arXiv preprint arXiv:2512.01351},
year = {2026}
}
备注
Paper accepted to ICLR 2026