中文

面向视觉 Transformer 的统一局部与全局注意力交互建模

计算机视觉与模式识别 2024-12-30 v1 人工智能 机器学习

摘要

我们提出了一种新方法,扩展了视觉转换器(ViT)的自注意力机制,以实现对各种数据集上更精确的对象检测。ViT 在目标检测、分割和分类等图像理解任务中表现出强大的能力,这在一定程度上归功于其能够利用视觉标记之间相互作用所提供的全局信息。然而,ViT 中的自注意力机制受限于其无法在计算全局注意力之前,让视觉标记与相邻特征交换局部或全局信息。这是一个问题,因为在注意力(匹配)其他标记时,标记被隔离处理,价值的空间关系被忽略。这种隔离被点积相似性操作进一步加剧,使得来自不同语义类别的标记在视觉上看起来相似。为解决这些限制,我们引入了两种对传统自注意力框架的修改;一种新颖的激进卷积池化策略用于局部特征混合,以及一种新的概念注意力转换以促进语义概念之间的交互和特征交换。实验结果表明,在自注意力之前进行局部和全局信息交换显著提高了在挑战性目标检测任务上的性能,并在多个基准数据集和挑战性医疗数据集上具有良好的泛化能力。我们发布了源代码以及一个新的数据集,包含癌症肿瘤(混合细胞簇)。

关键词

引用

@article{arxiv.2412.18778,
  title  = {Unified Local and Global Attention Interaction Modeling for Vision Transformers},
  author = {Tan Nguyen and Coy D. Heldermon and Corey Toler-Franklin},
  journal= {arXiv preprint arXiv:2412.18778},
  year   = {2024}
}

备注

20 Pages, 24 figures