推理链长度如何影响LLMs对答案真实性的判断
计算与语言
2026-04-09 v1
摘要
大型语言模型(LLMs)已被广泛用作人类评估的可扩展替代品,但此类评估仍不完美,容易受到表层偏见的影响。一个可能的原因是,这些评估在判断答案正确性时缺乏足够的信息。随着具备推理能力的模型的兴起,向评估器暴露生成器的推理内容提供了更丰富的信息,是一个提高判断准确性的自然候选方案。然而,其实际影响在研究中仍未充分探讨。本文系统地研究了访问推理链如何影响LLM-based判断在事实性问题解答(QA)和数学推理基准中的表现。我们发现,弱评估器容易被推理存在所左右,频繁接受伴随流畅推理而不正确的答案,而强评估器则可以部分利用推理作为信息证据。然而,即使是强评估器,也会被看似高质量的推理链所误导。受控实验进一步揭示,推理链的流畅性和事实性是驱动评估器决策的关键信号。这些发现凸显了需要更健壮的LLM评估器,以在评估现代推理模型时区分真实推理质量与表面流畅性的必要性。
引用
@article{arxiv.2604.06756,
title = {How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality},
author = {Minzhu Tu and Shiyu Ni and Keping Bi},
journal= {arXiv preprint arXiv:2604.06756},
year = {2026}
}
备注
ACL2026 Main