中文

具有 Wasserstein 距离感知注意力的随机视觉 Transformer

计算机视觉与模式识别 2023-12-01 v1 人工智能

摘要

自监督学习是从有限标注数据中获取知识最有前景的方法之一。尽管近年来取得了重大进展,自监督模型给从业者带来了挑战,因为它们不易提供关于模型置信度与不确定性的洞察。解决这一问题并非易事,主要原因在于实现能够利用预训练期间学到的潜在表示而不依赖显式标签的技术十分复杂。受此启发,我们提出了一种新型随机视觉 Transformer,将不确定性与距离感知整合进自监督学习(SSL)流程中。与传统的确定性向量嵌入不同,我们的新型随机视觉 Transformer 将图像块编码为椭圆高斯分布嵌入。值得注意的是,这些随机表示嵌入的注意力矩阵使用基于 Wasserstein 距离的注意力计算,有效利用了这些嵌入的分布特性。此外,我们提出了一种基于 Wasserstein 距离的正则化项,用于预训练与微调过程,从而将距离感知引入潜在表示。我们在不同任务上进行了大量实验,包括分布内泛化、分布外检测、数据集损坏、半监督设定,以及向其他数据集与任务的迁移学习。我们提出的方法取得了更优的准确率与校准性能,在多种数据集的广泛实验中超越了自监督基线。

关键词

引用

@article{arxiv.2311.18645,
  title  = {Stochastic Vision Transformers with Wasserstein Distance-Aware Attention},
  author = {Franciskus Xaverius Erick and Mina Rezaei and Johanna Paula Müller and Bernhard Kainz},
  journal= {arXiv preprint arXiv:2311.18645},
  year   = {2023}
}