通过稀疏高斯过程校准Transformer
机器学习
2025-09-11 v4 机器学习
摘要
Transformer模型在自然语言处理、语音识别与计算机视觉的广泛应用的预测任务中取得了卓越成功。将Transformer的成功拓展至安全关键领域需要经校准的不确定性估计,而这仍待探索。为此,我们提出稀疏高斯过程注意力(SGPA),其在Transformer中多头注意力块(MHA)的输出空间直接进行贝叶斯推断以校准其不确定性。它将缩放点积操作替换为有效的对称核,并利用稀疏高斯过程(SGP)技术近似MHA输出的后验过程。在经验上,在文本、图像与图的一系列预测任务中,基于SGPA的Transformer取得了有竞争力的预测精度,同时明显改善了分布内校准、分布外鲁棒性与检测。
关键词
引用
@article{arxiv.2303.02444,
title = {Calibrating Transformers via Sparse Gaussian Processes},
author = {Wenlong Chen and Yingzhen Li},
journal= {arXiv preprint arXiv:2303.02444},
year = {2025}
}
备注
Published at The Eleventh International Conference on Learning Representations (ICLR 2023). ECE updated, typo fixed