中文

评估数据驱动回归模型(再)校准的量化不确定性质量

机器学习 2026-04-23 v3 机器学习

摘要

在安全关键型应用中,数据驱动模型不仅要准确,还要提供可靠的不确定性估计。这种属性通常称为校准,对风险意识决策至关重要。在回归问题中,已涌现出多种校准指标和校准方法。然而,这些指标在定义、假设和尺度上存在显著差异,导致难以解释和跨研究比较结果。此外,大多数校准方法仅使用小部分指标进行评估,留下了改进是否在不同校准概念范畴内普遍适用的疑问。本文我们系统地从文献中提取并对回归校准指标进行分类,独立于特定建模方法或校准方法对这些指标进行基准测试。通过使用真实数据、合成数据和人工失校准数据进行受控实验,我们展示校准指标经常会产生相互冲突的結果。我们的分析揭示了 substantial 的不一致性:许多指标在对同一校准结果的评估上存在分歧,甚至有些指标会给出相互矛盾的结论。这种不一致性尤其令人关注,因为它可能允许通过挑选指标来制造误导性的成功印象。我们确定Expected Normalized Calibration Error(ENCE)和Coverage Width-based Criterion(CWC)是我们测试中最可靠的指标。我们的发现凸显了校准研究中指标选择的关键作用。

关键词

引用

@article{arxiv.2508.17761,
  title  = {Evaluating the Quality of the Quantified Uncertainty for (Re)Calibration of Data-Driven Regression Models},
  author = {Jelke Wibbeke and Nico Schönfisch and Sebastian Rohjans and Andreas Rauh},
  journal= {arXiv preprint arXiv:2508.17761},
  year   = {2026}
}