中文

面向代理不确定性量化的proper评分规则

人工智能 2026-05-26 v1

摘要

语言模型代理在轨迹过程中发出不确定性信号,但现有的代理级不确定性量化评估往往混合了排序实用性与概率真实性。AUROC、AUPRC、风险-覆盖率、轨迹 ECE 和标量化轨迹得分评估判别性、分箱校准或折叠摘要,但并未严格引导完整的前缀条件成功概率轨迹 qt=Pπ(Y=1Ht)q_t = P^{\pi}(Y=1 | H_t)。基于前瞻性proper评分,我们引入轨迹proper评分(Trajectory Proper Score, TPS),这是一族面向任何每一步不确定性信号的严格proper轨迹级评分规则,将其校准为最终成功的概率。在完全观测下,我们证明了 TPS 在所选评分族和权重计划内严格引导成功概率过程。我们将该构造扩展到行政上被 censured 的轨迹,通过将完整数据得分投影到可观测停止前缀,从而得到一个确切的 qZq_Z 加权简化得分以及当 qZq_Z 未被估计时可获得的可计算近似值。我们进一步表明,常见的轨迹评估者针对的目标比完整的前缀条件概率过程更弱:轨迹 ECE 是分辨率不敏感的,而标量化轨迹 Brier 仅引导折叠后的标量,而非完整的轨迹。在 StrategyQA、Tau2-Bench、HotpotQA 和 WebShop 上的实验表明,这些理论区别在实际操作中是可见的:概率校准可以显著改变 TPS 而几乎不影响排序指标,简化的 censured 近似值相对于仅用完整数据评估可能会改变判断。

关键词

引用

@article{arxiv.2605.24756,
  title  = {Proper Scoring Rules for Agentic Uncertainty Quantification},
  author = {Suresh Raghu and Satwik Pandey and Shashwat Pandey},
  journal= {arXiv preprint arXiv:2605.24756},
  year   = {2026}
}

备注

38 pages, 2 figures