中文

DuoFormer:通过局部与全局注意力视觉Transformer利用层次化表示

计算机视觉与模式识别 2025-06-17 v1

摘要

尽管Transformer在医学应用中得到广泛采用,但通过Transformer进行多尺度学习的研究仍然有限,而层次化表示被认为有利于计算机辅助医学诊断。我们提出了一种新颖的层次化Transformer模型,巧妙地结合了卷积神经网络(CNN)的特征提取能力与视觉Transformer(ViT)的高级表示潜力。为解决ViT中归纳偏置缺失和对大规模训练数据集的依赖问题,我们的模型采用CNN骨干网络生成层次化视觉表示。这些表示通过创新的分块标记化过程适配为Transformer输入,保留了继承的多尺度归纳偏置。我们还引入了一种尺度感知注意力机制,直接捕捉尺度内和尺度间的关联。该机制补充了分块注意力,通过增强空间理解和保持全局感知,我们分别称之为局部注意力和全局注意力。我们的模型在分类准确率方面显著优于基线模型,展示了其在弥合CNN与ViT之间差距方面的效率。各组件设计为即插即用,可适配不同的CNN架构和多种应用。代码可在https://github.com/xiaoyatang/DuoFormer.git获取。

关键词

引用

@article{arxiv.2506.12982,
  title  = {DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer},
  author = {Xiaoya Tang and Bodong Zhang and Man Minh Ho and Beatrice S. Knudsen and Tolga Tasdizen},
  journal= {arXiv preprint arXiv:2506.12982},
  year   = {2025}
}