中文

大规模推理模型置信估计器可靠性?基于高风险领域的系统基准

计算与语言 2026-01-22 v2

摘要

大规模推理模型 (LRMs) 的失配问题削弱了其在高风险领域的可靠性, necessitating 方法准确估计其长期、多步骤输出的置信水平。为填补这一空白,我们引入 Reasoning Model Confidence estimation Benchmark (RMCB),一个来自六类不同架构家族中 347,496 条推理痕迹的公共资源。该基准由多样化的数据套件构成,涵盖临床、金融、法律和数学推理等高风险领域,另外包括复杂常规推理基准,所有样本均提供正确性标注。在 RMCB 上,我们对超过十种不同表示基方法进行大规模经验评估,涵盖顺序、图基和文本基架构。我们的核心发现是,判别力 (AUROC) 与校准 (ECE) 之间存在持久权衡:文本基编码器获得最佳 AUROC (0.672),而结构感知模型获得最佳 ECE (0.148),没有单一方法同时在两者上占据优势。此外,我们发现架构复杂度的增加并不一定可靠地超越更简单的顺序基线,表明仅依赖块级隐藏状态的方法存在性能上限。该工作为该任务提供了最全面的基准,确立了严格的基线,并展示了当前表示基范式的局限性。

关键词

引用

@article{arxiv.2601.08134,
  title  = {How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains},
  author = {Reza Khanmohammadi and Erfan Miahi and Simerjot Kaur and Ivan Brugere and Charese H. Smiley and Kundan Thind and Mohammad M. Ghassemi},
  journal= {arXiv preprint arXiv:2601.08134},
  year   = {2026}
}

备注

Accepted to the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026) main conference