DuoFormer:利用局部与全局注意力实现层次化视觉表征
计算机视觉与模式识别
2024-07-22 v1 人工智能
摘要
本文提出一种新型层次化 transformer 模型,擅长集成卷积神经网络 (CNN) 的特征提取能力与视觉 transformer (ViT) 的先进表征潜能。针对 ViT 缺乏归纳偏置及依赖大量训练数据的不足,本模型采用 CNN 主干网络生成层次化视觉表征。这些表征随后通过一种创新的 patch tokenization 被适配用于 transformer 输入。我们还引入了"尺度注意力"机制,以捕捉跨尺度依赖关系,补充 patch 注意力以增强空间理解并保持全局感知。我们的方法在小型和中型医疗数据集上显著优于基准模型,显示出其效率与通用性。该模型的组件设计为即插即用,可适用于不同的 CNN 架构,并可适用于多个应用。代码已公开于 https://github.com/xiaoyatang/DuoFormer.git。
引用
@article{arxiv.2407.13920,
title = {DuoFormer: Leveraging Hierarchical Visual Representations by Local and Global Attention},
author = {Xiaoya Tang and Bodong Zhang and Beatrice S. Knudsen and Tolga Tasdizen},
journal= {arXiv preprint arXiv:2407.13920},
year = {2024}
}
备注
11 pages, 5 figures