面向视觉Transformer的统一局部与全局注意力交互建模
介观与纳米尺度物理
2026-03-10 v4
摘要
我们提出一种新方法,扩展视觉Transformer(ViT)的自注意力机制,以实现对多样数据集上更精确的对象检测。ViT在图像理解任务(如对象检测、分割和分类)方面表现强劲,这部分归功于其能够利用视觉标记之间相互作用的全局信息。然而,ViT的自注意力机制存在局限,因为它们不允许视觉标记在计算全局注意力前与相邻特征交换局部或全局信息。这一问题在于标记在注意力(匹配)其他标记时被视为孤立状态,导致宝贵的空间关系被忽略。这种孤立性被点积相似性操作进一步加剧,使得来自不同语义类别的标记在视觉上看起来相似。为此,我们引入对传统自注意力框架的两种修改;一种新颖的激进卷积池化策略用于局部特征混合,以及一种新的概念注意力转换以促进语义概念之间的交互和特征交换。实验结果表明,自注意力前视觉特征之间的局部和全局信息交换显著提高了在挑战性对象检测任务上的性能,并在多个基准数据集和挑战性医疗数据集上实现广泛泛化。我们发布了源代码和一个新的癌症肿瘤(嵌合细胞簇)数据集。
关键词
引用
@article{arxiv.2412.18777,
title = {Transfer Entropy and Flow of Information in Two-Skyrmion System},
author = {Tenta Tani and Soma Miki and Hiroki Mori and Minori Goto and Yoshishige Suzuki and Eiiti Tamura},
journal= {arXiv preprint arXiv:2412.18777},
year = {2026}
}
备注
16 pages, 9 figures