中文

通过核-特征对稀疏变分高斯过程实现自注意力

机器学习 2024-05-29 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

虽然 Transformer 的强大能力显著提升了预测精度,但它也可能产生过度自信的预测,并需要校准的不确定性估计,这通常可以通过高斯过程 (GP) 来解决。现有工作将具有对称核的 GP 在变分推断下应用于注意力核;然而,这忽略了注意力核本质上是不对称的这一事实。此外,对于大规模数据,推导 GP 后验的复杂度仍然很高。在这项工作中,我们提出了核-特征对稀疏变分高斯过程 (KEP-SVGP),用于构建具有不确定性感知的自注意力机制,其中注意力核的不对称性通过核 SVD (KSVD) 处理,并获得了降低的复杂度。通过 KEP-SVGP,i) 由 KSVD 关于注意力核的两组奇异向量诱导的 SVGP 对完全表征了不对称性;ii) 仅使用来自 KSVD 的一小组伴随特征函数,SVGP 后验的推导可以基于包含奇异值的对角矩阵的求逆,从而有助于降低时间复杂度;iii) 推导了证据下界,以便可以利用它来优化变分参数和网络权重。实验验证了我们在分布内、分布偏移和分布外基准测试上的卓越性能和效率。

关键词

引用

@article{arxiv.2402.01476,
  title  = {Self-Attention through Kernel-Eigen Pair Sparse Variational Gaussian Processes},
  author = {Yingyi Chen and Qinghua Tao and Francesco Tonin and Johan A. K. Suykens},
  journal= {arXiv preprint arXiv:2402.01476},
  year   = {2024}
}

备注

We propose Kernel-Eigen Pair Sparse Variational Gaussian Processes (KEP-SVGP) for building uncertainty-aware self-attention where the asymmetry of attention kernel is tackled by KSVD and a reduced time complexity is acquired