中文

智能体置信度校准

人工智能 2026-01-23 v1 计算与语言

摘要

AI智能体正迅速从被动的语言模型发展为执行复杂、多步骤任务的自主系统。然而,它们在失败时的过度自信仍然是部署到高风险环境中的根本障碍。现有的校准方法是为静态的单轮输出构建的,无法解决智能体系统的独特挑战,例如沿轨迹的复合错误、来自外部工具的不确定性以及不透明的失败模式。为应对这些挑战,我们首次引入了智能体置信度校准问题,并提出了整体轨迹校准(HTC),这是一个新颖的诊断框架,能够提取从宏观动态到微观稳定性的丰富过程级特征,覆盖智能体的整个轨迹。HTC由一个简单、可解释的模型驱动,在八个基准测试、多个LLMs和多样化的智能体框架中,在校准和区分度方面均持续超越强大的基线。除了性能之外,HTC还带来了三项关键进展:它通过揭示失败背后的信号提供了可解释性,通过跨领域应用而无需重新训练实现了可迁移性,并通过一个通用智能体校准器(GAC)在域外GAIA基准测试上实现了最佳校准(最低ECE),从而达成了泛化能力。这些贡献共同建立了一个新的以过程为中心的置信度校准范式,为诊断和增强AI智能体的可靠性提供了一个框架。

关键词

引用

@article{arxiv.2601.15778,
  title  = {Agentic Confidence Calibration},
  author = {Jiaxin Zhang and Caiming Xiong and Chien-Sheng Wu},
  journal= {arXiv preprint arXiv:2601.15778},
  year   = {2026}
}

备注

37 pages, 15 figures, 12 tables