置换共识列表评判:稳健事实性评估方法
计算与语言
2026-05-19 v3 人工智能
摘要
大型语言模型(LLM)如今被广泛用作评判器,但其决策在本应无关的呈现方式选择下可能会发生变化。我们研究了这种不稳定性的一个来源:列表式事实性评估中候选顺序敏感性,即多个答案看起来都相当精致,但在幻觉风险上差异巨大。我们引入了 PCFJudge,这是一种推理时方法,通过对同一候选集合的多个排序重复运行相同的事实性优先列表提示,并将 resulting 分数、排名和不确定性信号聚合为单个共识决策。在 RewardBench 2 事实性数据集上,使用 GPT-5.4 时,最终七次置换聚合(K=7)将 Top-1 选择准确率从 86.00% 提升至 91.33%,使用 Claude Sonnet 4.6 时将准确率从 86.33% 提升至 89.67%。这些结果表明,候选顺序可能是事实性评判错误的重要来源,而对这种 nuisance 变异进行边际化可提高 LLM 评估的可靠性。
引用
@article{arxiv.2603.20562,
title = {Permutation-Consensus Listwise Judging for Robust Factuality Evaluation},
author = {Tianyi Huang and Nathan Huang and Justin Tang and Wenqian Chen and Elsa Fan},
journal= {arXiv preprint arXiv:2603.20562},
year = {2026}
}
备注
Accepted at the Fifth Workshop on Natural Language Generation, Evaluation, and Metrics at ACL 2026