中文

LLM 在多轮交互中的置信度估计

计算与语言 2026-05-15 v2

摘要

尽管置信度估计是缓解大语言模型(LLM)幻觉的有前景的方向,但当前研究几乎全部聚焦于单轮场景。在多轮对话中,模型置信度的动态行为——即随着上下文累积和歧义逐步消解——仍然鲜有探索。本文首次系统地研究多轮交互中的置信度估计,构建了一个基于两个关键需求的正式评估框架:每轮校准性(per-turn calibration)以及置信度随信息获取增加而单调性(monotonicity of confidence as more information becomes available)。为此,我们引入了新的指标,包括长度归一化的期望校准误差(InfoECE),以及一种新的“Hinter-Guesser”范式,用于生成受控的评估数据集。我们的实验表明,广泛使用的置信度技术在多轮对话中在校准性和单调性方面表现不佳。相比之下,我们引入的一种新型基于逻辑的探针 P(Sufficient) 证明更为有效,能稳健地跟踪证据的积累,并将其与对话填充词区分开来。我们的工作为开发更可靠、更值得信赖的对话智能体提供了基础方法。

关键词

引用

@article{arxiv.2601.02179,
  title  = {Confidence Estimation for LLMs in Multi-turn Interactions},
  author = {Caiqi Zhang and Ruihan Yang and Xiaochen Zhu and Chengzu Li and Tiancheng Hu and Yijiang River Dong and Deqing Yang and Nigel Collier},
  journal= {arXiv preprint arXiv:2601.02179},
  year   = {2026}
}

备注

ACL 2026 Findings