中文

概率预测的校准度量

统计理论 2022-11-15 v2 机器学习 统计方法学 统计理论

摘要

预测常常以概率形式给出;例如,预测可能是明天有降水,但概率仅为 30%。给定此类概率预测以及实际结果,“可靠性图”有助于检测和诊断预测与结果之间统计显著的差异——即所谓的“误校准”。经典的可靠性图将预测的观测值与期望值进行直方图统计;以软核密度估计替代硬直方图分箱也是另一种常见做法。但是,分箱或核的宽度哪种最好?观测值与期望值之间累积差异的图通过直接将误校准显示为图的割线斜率,在很大程度上回避了这个问题。即使割线的恒定偏移无关紧要,斜率也易于以定量精度感知;无需分箱或执行核密度估计。现有的标准误校准度量各自将可靠性图总结为单一标量统计量。累积图自然引出用于度量累积差异图偏离零的标量度量;良好校准对应于水平、平坦且偏离零很小的图。累积方法目前非常规,但提供了许多有利的统计学性质,这些性质由严谨证明和说明性数值示例支撑的数学理论所保证。特别地,基于分箱或核密度估计的度量不可避免地必须在统计置信度与分辨随预测概率变化的变动的能力之间权衡。加宽分箱或核会在牺牲部分分辨力的同时平均掉随机噪声。收窄分箱或核会在不平均掉那么多噪声的同时增强分辨力。

关键词

引用

@article{arxiv.2205.09680,
  title  = {Metrics of calibration for probabilistic predictions},
  author = {Imanol Arrieta-Ibarra and Paman Gujral and Jonathan Tannen and Mark Tygert and Cherie Xu},
  journal= {arXiv preprint arXiv:2205.09680},
  year   = {2022}
}

备注

50 pages, 36 figures