当两个 LLM 辩论时,两人都认为自己会赢
计算与语言
2025-06-10 v3 人工智能
机器学习
摘要
LLM 在面对对抗情况时能否准确调整自身置信水平?基于衡量静态事实性问答任务中模型置信度的前期研究,我们评估了大型语言模型 (LLM) 在动态、对抗性辩论情境中的表现,这种情境独特地结合了两个现实因素:(a) 多轮格式要求模型随新信息出现而更新信念,(b) 零和结构控制与任务相关的不确定性,因为双方高置信声称暗示系统性高估。我们组织了十个最新型 LLM 进行六十场三轮政策辩论,模型在每轮后私下评估自己赢得辩论的置信度 (0-100)。我们观察到五个令人担忧的模式:(1) 系统性高估:模型在辩论初始时的平均置信度为 72.9%,而理性基准为 50%;(2) 置信度升高:尽管辩论进行,模型反而提升了赢概率,最终轮平均为 83%;(3) 双方高估:在 61.7% 的辩论中,双方同时声称赢的概率 ≥75%,这在逻辑上不可能;(4) 持续自我辩论偏差:模型辩论自身副本时,置信度从 64.1% 提升至 75.2%;即便被明确告知自己赢的概率恰为 50%,置信度仍上升(从 50.0% 提升至 57.1%)。(5) 私人推理偏离公开置信度:模型的私下思考有时与公开置信度评估不符,这引发对链式思维推理忠实性的担忧。这些结果表明 LLM 在动态、多轮任务中缺乏准确自我评估或信念更新能力;随着 LLM 越来越多地被用于助手和代理角色而无需仔细审查,这是一个重大的担忧。实验代码已公开于 https://github.com/pradyuprasad/llms_overconfidence。
引用
@article{arxiv.2505.19184,
title = {When Two LLMs Debate, Both Think They'll Win},
author = {Pradyumna Shyama Prasad and Minh Nhat Nguyen},
journal= {arXiv preprint arXiv:2505.19184},
year = {2025}
}