中文

降低科学机器学习中的跨样本预测颤动

机器学习 2026-05-14 v1 材料科学 化学物理

摘要

科学机器学习报告预测性能,但不报告相同的预测是否会存活于不同的训练数据抽取。我们在9个化学基准测试中发现,两个在同一训练集上独立引导抽样训练的分类器,在整体准确率上相差仅3.3-4.2个百分点,但对8.0-21.8%的测试分子类别标签意见不一致。我们称此差距为“跨样本预测颤动”。标准的参数侧技术(深度集成、MC dropout、随机权重平均)无法缩小此差距;两种数据侧方法有效。第一种是K-引导抽样装袋法,可在无精度损失的情况下(K×K{\times}-ERM 计算)将颤动率在每个数据集上降低40-54%。第二种是我们的提议方法“双引导抽样”:两个在独立引导抽样上联合训练的网络,彼此之间通过对称-KL一致性损失实现预测一致性,在匹配的2×2{\times}-ERM 计算下,将颤动率进一步降低中位数45%。跨样本预测颤动值得在科学机器学习基准报告中与预测性能并列,因为在实际关注的指标上,参数侧方法与数据侧方法在此度量下是不可区分的。

关键词

引用

@article{arxiv.2605.13826,
  title  = {Reducing cross-sample prediction churn in scientific machine learning},
  author = {Gordan Prastalo and Kevin Maik Jablonka},
  journal= {arXiv preprint arXiv:2605.13826},
  year   = {2026}
}