LLM中的一致性困境:生成器-评估器一致性与错误脆弱性
计算机与社会
2026-06-16 v1 人工智能
摘要
大型语言模型越来越多地部署在依赖模型在没有外部验证的情况下评估自身输出的智能体管道中。这些管道的可靠性依赖于一个隐含假设:模型在生成输出和随后评估该输出时,以相同的方式应用相关概念。我们提出了一种新的度量,生成器-评估器自一致性,来直接测试这一假设,并将其应用于10个前沿模型的491个概念。我们首先发现自一致性存在显著差异。其次,我们发现在一个具有医生验证错误的临床环境(Proniakin et al., 2025)中,跨模型来看,自一致性较高的模型与更大的错误脆弱性相关。因此,即使模型一致地应用概念,它们也可能不安全部署。这是LLM中存在一致性困境的证据:自一致性在操作上有用,但更一致的模型也更容易出错。
引用
@article{arxiv.2606.30653,
title = {The Consistency Dilemma in LLMs: Generator-Evaluator Agreement and Vulnerability to Mistakes},
author = {Marina Mancoridis and Zoë Hitzig},
journal= {arXiv preprint arXiv:2606.30653},
year = {2026}
}