中文

谈两者差异:贝叶斯深度学习中的单种子基准测试何时会失败

机器学习 2026-04-28 v1

摘要

在有限数据环境下,评估指标如连续排序概率得分(CRPS)的单个终端均值本身也是随机变量,却常被报告为方法的稳定特性。我们研究了何时会导致这种做法失败。使用 50 个独立重复实验对六个回归数据集进行测试,显示 CRPS 方差轨迹在不同方法间差异显著,且不一定能用光滑的幂律衰减描述。具有学习异方差方差头的模型(如 MAP 和深度集成)可在真实数据集的中期训练规模上发展出显著且可重复的方差峰值,而 MC Dropout 和 Bayes by Backprop 则通常表现出光滑的方差收缩。这些峰值具有直接的实际后果:在首尔自行车数据集的方差峰值处,单次种子 MAP 估计的相对 RMSE 可达 93.6\%,且落在重复运行均值 ±10%\pm 10\% 范围内的概率降至 5.9\%。我们表明局部 CRPS 方差可直接反映单次种子估计误差,Spearman 相关系数在所有真实数据集上均超过 0.96。幂律拟合质量与单调性共同提供了方法层面轨迹规则性的紧凑概述。最后,用 β\beta-NLL 替代标准异方差目标,可显著降低不规则行为,符合该异方差训练目标贡献不稳定性的观点。实践者应在端点均值旁报告轨迹概述,并在高方差区域集中进行重复评估。

关键词

引用

@article{arxiv.2604.23114,
  title  = {A Tale of Two Variances: When Single-Seed Benchmarks Fail in Bayesian Deep Learning},
  author = {Qishi Zhan and Minxuan Hu and Liang He and Guansu Wang and Jiaxin Liu},
  journal= {arXiv preprint arXiv:2604.23114},
  year   = {2026}
}