中文

利用推理时随机注意力校准科学基础模型

机器学习 2026-05-12 v2 计算工程、金融与科学 机器学习

摘要

基于 Transformer 的科学基础模型正越来越多地被部署在高风险场景中,但当前的架构仅提供确定性输出,且对校准预测不确定性的支持有限。我们提出了随机注意力,这是一种样本平均的轻量级推理时修改方法,它通过将 softmax 权重替换为由单一集中参数控制归一化多项式样本,来实现注意力的随机化,并在无需重训练的情况下生成预测集成。为了设定该参数,我们引入了一个将随机注意力输出与目标相匹配的校准目标,从而产生一个高效的单变量事后调优问题。我们在用于天气和时间序列预测的科学基础模型以及几项回归任务上评估了该机制。在与具备不确定性感知的基线进行基准测试时,我们发现样本平均随机注意力实现了最强的原生校准,并在可比的校准水平下提供了最锐利的预测区间,其适应成本比次优基线低近三个数量级。

关键词

引用

@article{arxiv.2604.19530,
  title  = {Calibrating Scientific Foundation Models with Inference-Time Stochastic Attention},
  author = {Akash Yadav and Taiwo A. Adebiyi and Ruda Zhang},
  journal= {arXiv preprint arXiv:2604.19530},
  year   = {2026}
}