中文

通过稀疏高斯过程校准Transformer

机器学习 2025-09-11 v4 机器学习

摘要

Transformer模型在自然语言处理、语音识别与计算机视觉的广泛应用的预测任务中取得了卓越成功。将Transformer的成功拓展至安全关键领域需要经校准的不确定性估计,而这仍待探索。为此,我们提出稀疏高斯过程注意力(SGPA),其在Transformer中多头注意力块(MHA)的输出空间直接进行贝叶斯推断以校准其不确定性。它将缩放点积操作替换为有效的对称核,并利用稀疏高斯过程(SGP)技术近似MHA输出的后验过程。在经验上,在文本、图像与图的一系列预测任务中,基于SGPA的Transformer取得了有竞争力的预测精度,同时明显改善了分布内校准、分布外鲁棒性与检测。

关键词

引用

@article{arxiv.2303.02444,
  title  = {Calibrating Transformers via Sparse Gaussian Processes},
  author = {Wenlong Chen and Yingzhen Li},
  journal= {arXiv preprint arXiv:2303.02444},
  year   = {2025}
}

备注

Published at The Eleventh International Conference on Learning Representations (ICLR 2023). ECE updated, typo fixed