大规模推理模型置信估计器可靠性?基于高风险领域的系统基准
计算与语言
2026-01-22 v2
摘要
大规模推理模型 (LRMs) 的失配问题削弱了其在高风险领域的可靠性, necessitating 方法准确估计其长期、多步骤输出的置信水平。为填补这一空白,我们引入 Reasoning Model Confidence estimation Benchmark (RMCB),一个来自六类不同架构家族中 347,496 条推理痕迹的公共资源。该基准由多样化的数据套件构成,涵盖临床、金融、法律和数学推理等高风险领域,另外包括复杂常规推理基准,所有样本均提供正确性标注。在 RMCB 上,我们对超过十种不同表示基方法进行大规模经验评估,涵盖顺序、图基和文本基架构。我们的核心发现是,判别力 (AUROC) 与校准 (ECE) 之间存在持久权衡:文本基编码器获得最佳 AUROC (0.672),而结构感知模型获得最佳 ECE (0.148),没有单一方法同时在两者上占据优势。此外,我们发现架构复杂度的增加并不一定可靠地超越更简单的顺序基线,表明仅依赖块级隐藏状态的方法存在性能上限。该工作为该任务提供了最全面的基准,确立了严格的基线,并展示了当前表示基范式的局限性。
引用
@article{arxiv.2601.08134,
title = {How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains},
author = {Reza Khanmohammadi and Erfan Miahi and Simerjot Kaur and Ivan Brugere and Charese H. Smiley and Kundan Thind and Mohammad M. Ghassemi},
journal= {arXiv preprint arXiv:2601.08134},
year = {2026}
}
备注
Accepted to the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026) main conference