基于折线路径掩码的视觉 Transformer 注意力机制
计算机视觉与模式识别
2025-10-22 v2
摘要
全局依赖建模与空间位置建模是当前深度学习框架中基础架构设计的两个核心问题。最近,视觉 Transformer(Vision Transformer,ViT)通过利用自注意力机制的强大全局依赖建模能力,在计算机视觉领域取得了显著的成功。此外,Mamba2 通过显式建模空间相邻先验(spatial adjacency prior)通过结构化掩码(structured mask),在自然语言处理任务中展现出巨大的潜力。本文提出折线路径掩码注意力(Polyline Path Masked Attention,PPMA),将 ViT 的自注意力机制与 Mamba2 增强型结构化掩码相结合,充分发挥两者架构的互补优势。具体而言,我们首先通过引入二维折线路径扫描策略,对传统的 Mamba2 结构化掩码进行改进,得到相应的结构化掩码——折线路径掩码(polyline path mask),该掩码更好地保留了图像标记(token)之间的相邻关系。值得注意的是,我们对提出的折线路径掩码的结构特征进行了彻底的理论分析,并设计了高效的折线路径掩码计算算法。随后,我们将折线路径掩码嵌入到 ViT 的自注意力机制中,实现对空间相邻先验的显式建模。广泛的在标准基准上的实验,包括图像分类、目标检测和分割,表明我们的方法在基于状态空间模型和 Transformer 的先前最先进方法上均取得了优异成绩。例如,我们提出的 PPMA-T/S/B 模型在 ADE20K 语义分割任务上分别实现了 48.7%/51.1%/52.3% 的 mIoU,分别超过 RMT-T/S/B 0.7%/1.3%/0.3%。代码已公开于 https://github.com/zhongchenzhao/PPMA。
关键词
引用
@article{arxiv.2506.15940,
title = {Polyline Path Masked Attention for Vision Transformer},
author = {Zhongchen Zhao and Chaodong Xiao and Hui Lin and Qi Xie and Lei Zhang and Deyu Meng},
journal= {arXiv preprint arXiv:2506.15940},
year = {2025}
}