LOOPE:位置嵌入中可学习的最优补丁顺序
计算机视觉与模式识别
2026-04-14 v2 人工智能
摘要
位置嵌入(PE)在视觉转换器(ViT)中发挥着关键作用,由于自注意力的排列不变性,位置嵌入提供了空间信息。虽然绝对位置嵌入(APE)相对于相对位置嵌入(RPE)在理论上具有优势,特别是由于正弦函数能够保留空间归纳偏置,如单调性和平移不变性,但当将 2D 网格映射到 1D 序列时,便出现了一个根本性挑战。现有方法大多忽视或从未探讨补丁顺序对位置嵌入的影响。为此,我们提出 LOOPE,一种可学习的补丁排序方法,可为给定频率集合优化空间表示,提供一种原则化的补丁顺序优化方法。实证结果表明,我们的 PE 在各种 ViT 架构上显著提高了分类准确率。为严格评估位置嵌入的有效性,我们引入“三细胞实验”,一种新型的基准框架,用于评估 PE 在不同 ViT 架构中保留相对和绝对位置信息的能力。与标准评估不同,后者通常在带有和不带 PE 的模型之间报告 4% 到 6% 的性能差距,而我们的方法显示出惊人的 30% 到 35% 的差异,为更敏感的诊断工具提供了方法来衡量 PE 的有效性。我们的实验分析确认,所提出的 LOOPE 在保留相对和绝对位置信息方面表现出增强效果。
引用
@article{arxiv.2504.14386,
title = {LOOPE: Learnable Optimal Patch Order in Positional Embeddings for Vision Transformers},
author = {Md Abtahi Majeed Chowdhury and Md Rifat Ur Rahman and Akil Ahmad Taki},
journal= {arXiv preprint arXiv:2504.14386},
year = {2026}
}