概率度量支持AIWP与NWP模型输出的公平比较
应用统计
2025-06-05 v1 大气与海洋物理
机器学习
摘要
我们提出了一种新的度量方法,用于对人工智能天气预测(AIWP)模型和数值天气预测(NWP)模型的单值输出进行公平且有意义的比较,称为潜在连续排序概率得分(PC)。简言之,我们将物理驱动和数据驱动模型的确定性核心事后纳入同一种统计后处理技术,即等距分布回归(IDR)。然后我们将PC定义为后处理概率预报的平均连续排序概率得分(CRPS)。非负的PC度量量化了潜在的预测性能,并且在模型输出的严格单调递增变换下保持不变。当且仅当天气结果Y是模型输出X的固定非递减函数时,PC取得其最理想值零。PC度量以结果单位记录,其上界为结果之间平均绝对差的一半,并作为实时运行概率产品的平均CRPS的代理。当应用于WeatherBench 2数据时,我们的方法表明数据驱动的GraphCast模型优于领先的物理驱动的欧洲中期天气预报中心(ECMWF)高分辨率(HRES)模型。此外,HRES模型的PC度量与ECMWF集合预报的平均CRPS高度一致。在各种应用领域中,我们的方法支持在预先指定损失函数——这通常是且在预报竞赛、行政和基准设置中原则上更优的程序——会使竞争者处于不平等地位的设置中,对单值预报进行比较。
引用
@article{arxiv.2506.03744,
title = {Probabilistic measures afford fair comparisons of AIWP and NWP model output},
author = {Tilmann Gneiting and Tobias Biegert and Kristof Kraus and Eva-Maria Walz and Alexander I. Jordan and Sebastian Lerch},
journal= {arXiv preprint arXiv:2506.03744},
year = {2025}
}