验证验证者:揭示事实验证器中的陷阱与潜力
人工智能
2026-02-06 v2 计算与语言
机器学习
摘要
事实验证对于确保大语言模型(LLM)应用的可靠性至关重要。本研究评估了 12 个预训练 LLM 和 1 个专用事实验证器,包括前沿 LLM 和开源推理 LLM,使用来自 14 个事实验证基准的示例。我们分享了三个旨在指导未来更稳健事实验证器发展的发现。第一,我们强调处理数据集中的标注错误和歧义的重要性,表明约 16% 的歧义或错误标注数据会显著影响模型排名。忽视这一问题可能导致比较评估中产生误导性结论,我们建议采用利用 LLM-as-a-judge 的系统性流水线来大规模识别这些问题。第二,我们发现前沿 LLM 结合少样本上下文示例(在先前的研究中常被忽视)能够达到顶尖性能。因此,我们建议未来研究将这些简单但高效的基线纳入比较。最后,尽管前沿 LLM 效果显著,但其成本高昂,推动了小型微调事实验证器的发展。我们表明这些小型模型仍有改进空间,特别是在需要复杂推理的实例上。令人鼓舞的是,我们证明通过合成多跳推理数据增强训练可以显著提升它们在这类实例上的能力。我们在 https://github.com/just1nseo/verifying-the-verifiers 发布了我们的代码、模型和数据集。
引用
@article{arxiv.2506.13342,
title = {Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers},
author = {Wooseok Seo and Seungju Han and Jaehun Jung and Benjamin Newman and Seungwon Lim and Seungbeen Lee and Ximing Lu and Yejin Choi and Youngjae Yu},
journal= {arXiv preprint arXiv:2506.13342},
year = {2026}
}
备注
Accepted to COLM 2025