中文

序列与圆周:探索图像块间的关系

计算机视觉与模式识别 2022-10-20 v2

摘要

视觉 Transformer(ViT)已在各种视觉任务中取得最先进结果。它利用可学习的位置嵌入(PE)机制来编码每个图像块的位置。然而,目前尚不清楚这种可学习的 PE 是否确实必要及其好处是什么。本文探索了两种利用关于图像块空间排布的先验知识来编码个体块位置的替代方式。一种称为序列关系嵌入(SRE),另一种称为圆周关系嵌入(CRE)。其中,SRE 将所有块视为有序,相邻块具有相同的间隔距离。CRE 将中心块视为圆心,并基于四邻域原则度量其余块到中心的距离。具有不同半径的多个同心圆组合不同的块。最后,我们在三种经典 ViT 上实现这两种关系,并在四个流行数据集上测试。实验表明,SRE 和 CRE 可替代 PE,在减少随机可学习参数的同时达到相同性能。将 SRE 或 CRE 与 PE 结合比仅使用 PE 获得更好性能。

关键词

引用

@article{arxiv.2210.09871,
  title  = {Sequence and Circle: Exploring the Relationship Between Patches},
  author = {Zhengyang Yu and Jochen Triesch},
  journal= {arXiv preprint arXiv:2210.09871},
  year   = {2022}
}

备注

7 pages, 1 figure