中文

安全关键应用中校准检查的配方

统计方法学 2026-04-30 v1 机器学习

摘要

安全关键预测系统(如自动驾驶车辆、气象预报和医疗监测)常依赖概率预测。这些预测关于可能的未来结果进行预测,其质量和鲁棒性需要被验证和认证。通常仅评估准确率——即预测的均值——与真实结果进行比较。然而,对于安全关键情境和不确定性下的决策,应检查预测的完整分布属性:观察到的预测误差是否实际遵循预测的概率分布?为此,我们引入了一个校准检查框架:用于验证预测分布属性的统计检验,当针对大量样本数据进行测量时,该框架会产生单一的接受/拒绝决策。以区别于通常的校准计算后者产生一个或多个连续校准分数并需要专业知识在验证工作流程中实施,我们进一步引入了校准测试的修改,使其 (a) 仅拒绝过于自信的预测,允许在安全关键环境中进行悲观或保守的预测,以及 (b) 容忍大量验证样本中小规模、可接受的偏差。我们将校准检查过程组织为由四个步骤组成的模块化管道:(i) 数据模型、(ii) 所选指标、(iii) 假设表述、(iv) 检验程序。每个步骤由可独立替换的组件组成,从而支持大众多用例和权衡。我们在两个互补的示例问题上演示了该框架的适用性,分别是气象预报和机器人姿态估计。

关键词

引用

@article{arxiv.2604.26479,
  title  = {Recipes for Calibration Checks in Safety-Critical Applications},
  author = {Romeo Valentin},
  journal= {arXiv preprint arXiv:2604.26479},
  year   = {2026}
}

备注

36 pages, 22 figures. Manuscript prepared with Typst