点评度误导:多模态逆问题的评估协议
机器学习
2026-05-25 v1 高能物理 - 实验
摘要
科学重构的评估主要依赖点评度 - RMSE、MAE、逐事件分辨率 - 并隐含地假设更低的误差意味着更好的重构。我们指出,这一假设在后验分布具有非零宽度的逆问题中结构性地失败。根据总方差定理,最小化 MSE 或 MAE 的点估计算得的边缘谱严格小于真实值。这种偏差与架构、训练和数据集大小无关,它压缩了下游科学测量所依赖的谱特征 - 尾部、模式、形状。我们提出了三个互不重叠、各针对不同失效模式的评估协议:通过 CRPS 实现逐事件分布准确性、通过谱保真度诊断实现 population-level 边缘准确性、通过覆盖率-based 校准实现不确定性可信度。在一个具有解析后验的合成基准和一个来自粒子物理的真实的多对一逆问题上,模型在点评度和分布性评度之间的排序发生反转,校准进一步将在 CRPS 下难以区分的架构进行了分离。评估协议本身而非模型,决定了科学结论。
引用
@article{arxiv.2605.22891,
title = {Pointwise Metrics Mislead: An Evaluation Protocol for Multimodal Inverse Problems},
author = {Mads H. Baattrup and Jörn Bach and Laurids Jeppe and Finn Labe and Alexander Grohsjean and Christian Schwanenberger and Peer Stelldinger},
journal= {arXiv preprint arXiv:2605.22891},
year = {2026}
}
备注
29 pages, 9 figures, and 8 tables (including appendix)