中文

置信度应在多轮对话中更好地校准

计算与语言 2026-04-08 v1

摘要

大型语言模型(LLM)正日益应用于金融、医疗和教育等高风险领域,其中可靠的多轮与用户交互至关重要。然而,现有置信度估计和校准工作主要聚焦于单轮场景,忽视了多轮对话中的风险与潜力。在本工作中,我们提出多轮校准任务,将校准从静态属性重新框定为动态挑战,成为可靠多轮对话的核心问题,需要在对话历史的条件下,对每一轮的模型置信度进行校准。我们首先揭示了该设置的风险:使用跟踪多轮校准动态的新指标 ECE@T(Expected Calibration Error at turn T),我们展示了用户反馈(如说服)可导致多轮校准恶化。为解决此问题,我们提出 MTCal,通过拟合校准目标来最小化 ECE@T,进而利用已校准置信度构建 ConfChat—a 解码策略,提升模型在多轮交互中的事实性和一致性。大量实验表明,MT-Cal 在多轮校准方面取得卓越且持久的性能,ConfChat 在保持甚至提升模型在多轮交互中的表现方面也同样出色。我们的结果表明,多轮校准是推动 LLM 校准向安全、可靠和实际应用规模化的关键环节之一。

关键词

引用

@article{arxiv.2604.05397,
  title  = {Confidence Should Be Calibrated More Than One Turn Deep},
  author = {Zhaohan Zhang and Chengzhengxu Li and Xiaoming Liu and Chao Shen and Ziquan Liu and Ioannis Patras},
  journal= {arXiv preprint arXiv:2604.05397},
  year   = {2026}
}