MoViT:面向医学图像分析的记忆化视觉Transformer
计算机视觉与模式识别
2023-10-03 v3
摘要
来自Transformer的长程依赖与来自卷积神经网络(CNNs)的图像内容局部表示的协同,因其互补优势,已推动先进架构的出现并提升多种医学图像分析任务的性能。然而,与CNNs相比,Transformer由于参数量更大且缺乏归纳偏置,需要多得多的训练数据。对日益增长的大规模数据集的需求持续构成问题,尤其在医学影像领域,标注负担与数据保护导致数据可用性有限。受人类将新证据与既往记忆经验相关联的决策过程启发,我们提出记忆化视觉Transformer(MoViT)以缓解成功训练与部署基于Transformer架构对大规模数据集的需求。MoViT利用外部记忆结构在训练阶段缓存历史注意力快照。为防止过拟合,我们引入一种创新的记忆更新方案——注意力时间移动平均,以历史移动平均更新所存外部记忆。为加速推理,我们设计了一种原型注意力学习方法,将外部记忆蒸馏为更小的代表性子集。我们在公开组织学图像数据集与内部MRI数据集上评估了该方法,表明MoViT应用于不同医学图像分析任务时,能在各种数据条件下超越原始Transformer模型,尤其在仅有少量标注数据可用时。更重要的是,MoViT仅用3.0%的训练数据即可达到与ViT竞争的性能。
引用
@article{arxiv.2303.15553,
title = {MoViT: Memorizing Vision Transformers for Medical Image Analysis},
author = {Yiqing Shen and Pengfei Guo and Jingpu Wu and Qianqi Huang and Nhat Le and Jinyuan Zhou and Shanshan Jiang and Mathias Unberath},
journal= {arXiv preprint arXiv:2303.15553},
year = {2023}
}