评估数据驱动回归模型(再)校准的量化不确定性质量
机器学习
2026-04-23 v3 机器学习
摘要
在安全关键型应用中,数据驱动模型不仅要准确,还要提供可靠的不确定性估计。这种属性通常称为校准,对风险意识决策至关重要。在回归问题中,已涌现出多种校准指标和校准方法。然而,这些指标在定义、假设和尺度上存在显著差异,导致难以解释和跨研究比较结果。此外,大多数校准方法仅使用小部分指标进行评估,留下了改进是否在不同校准概念范畴内普遍适用的疑问。本文我们系统地从文献中提取并对回归校准指标进行分类,独立于特定建模方法或校准方法对这些指标进行基准测试。通过使用真实数据、合成数据和人工失校准数据进行受控实验,我们展示校准指标经常会产生相互冲突的結果。我们的分析揭示了 substantial 的不一致性:许多指标在对同一校准结果的评估上存在分歧,甚至有些指标会给出相互矛盾的结论。这种不一致性尤其令人关注,因为它可能允许通过挑选指标来制造误导性的成功印象。我们确定Expected Normalized Calibration Error(ENCE)和Coverage Width-based Criterion(CWC)是我们测试中最可靠的指标。我们的发现凸显了校准研究中指标选择的关键作用。
引用
@article{arxiv.2508.17761,
title = {Evaluating the Quality of the Quantified Uncertainty for (Re)Calibration of Data-Driven Regression Models},
author = {Jelke Wibbeke and Nico Schönfisch and Sebastian Rohjans and Andreas Rauh},
journal= {arXiv preprint arXiv:2508.17761},
year = {2026}
}