中文

大语言模型中 Overton 多元主义的基准测试

人工智能 2026-03-03 v2

摘要

我们引入了 OVERTONBENCH,一个用于测量大语言模型(LLMs)中 Overton 多元主义的新框架——即模型输出中代表多元观点的程度。我们(i)将 Overton 多元主义形式化为集合覆盖度量(OVERTONSCORE),(ii)开展大规模美国代表性人类研究(N = 1208;60 个问题;8 个 LLM),(iii)开发了一个自动化基准测试 closely 复现人类判断。平均而言,模型的 OVERTONSCORE 为 0.35–0.41,DeepSeek V3 表现最佳;然而所有模型仍远低于理论最大值 1.0,揭示了显著的改进空间。由于反复进行大规模人类研究成本高昂且耗时,可扩展的评估工具对于模型开发至关重要。因此,我们提出了一种自动化基准测试,与人类判断实现了高秩相关性(ρ = 0.88),提供了一个实用的代理指标而无需替代人类评估。通过将多元对齐从规范性目标转变为可测量的基准,我们的工作为系统性地迈向更具多元主义的大语言模型奠定了基础。

关键词

引用

@article{arxiv.2512.01351,
  title  = {Benchmarking Overton Pluralism in LLMs},
  author = {Elinor Poole-Dayan and Jiayi Wu and Taylor Sorensen and Jiaxin Pei and Michiel A. Bakker},
  journal= {arXiv preprint arXiv:2512.01351},
  year   = {2026}
}

备注

Paper accepted to ICLR 2026