MedFormer:具有内容感知双稀疏选择注意力的层次性医学视觉变换器
计算机视觉与模式识别
2025-08-06 v2
摘要
医学图像识别是促进临床诊断的关键方式,使疾病和异常情况的识别更加准确和及时。基于视觉变换器的方法在处理各种医学识别任务方面已证明有效。然而,这些方法面临两个主要挑战:其一是常针对特定任务且以建构器为定制,限制了其通用适用性;其二是通常要么采用全注意力建模长程依赖,导致计算成本高,要么依赖手工稀疏注意力,可能导致性能次优。为解决这些问题,我们提出 MedFormer,这是一种高效医学视觉变换器,包含两个关键思想:其一采用金字塔缩放结构作为各种医学图像识别任务(包括图像分类和密集预测任务如语义分割和病灶检测)的通用背板。该结构在保持高性能的同时实现层次特征表示并降低特征图的计算负荷;其二引入一种具有内容感知的新型双稀疏选择注意力(DSSA),以提高计算效率和对噪声的鲁棒性,同时保持高性能。作为 MedFormer 的核心技术,DSSA 旨在显式地关注最相关的内容。理论分析表明,MedFormer 在通用性和效率方面均优于现有的医学视觉变换器。广泛的实验结果表明,在各种影像模态数据集上,MedFormer 在上述三种医学图像识别任务中均能持续提升性能。MedFormer 提供了一个高效且通用的医学图像识别解决方案,具有强大的临床应用潜力。
引用
@article{arxiv.2507.02488,
title = {MedFormer: Hierarchical Medical Vision Transformer with Content-Aware Dual Sparse Selection Attention},
author = {Zunhui Xia and Hongxing Li and Libin Lan},
journal= {arXiv preprint arXiv:2507.02488},
year = {2025}
}
备注
13 pages, 9 figures, 10 tables; The code is available at https://github.com/XiaZunhui/MedFormer