中文

DCMM-Transformer: 用于医学影像的度数校正混合成员注意力

计算机视觉与模式识别 2025-11-18 v1 人工智能

摘要

医学影像表现出潜在的解剖分组,如器官、组织和病理区域,标准的视觉 Transformer (ViT) 无法利用这些结构。虽然 recent work 如 SBM-Transformer 试图通过随机二元掩码纳入此类结构,但 suffer 从 non-differentiability、training instability 以及无法建模复杂社区结构。我们提出了 DCMM-Transformer,这是一种用于医学影像分析的新型 ViT 架构,纳入了 Degree-Corrected Mixed-Membership (DCMM) 模型作为自注意力中的 additive bias。不同于依赖乘性掩码和二元抽样的先前方法,我们的方法以全可微、可解释的方式引入社区结构和度异质性。针对 diverse medical imaging 数据集进行的全面实验,包括脑、胸、乳腺和眼科模态,证明了所提出方法的卓越性能和广泛适用性。此外,所学到的 group 结构和结构化注意力调制大大增强了可解释性,通过产生解剖上有意义且语义连贯的注意力图实现。

关键词

引用

@article{arxiv.2511.12047,
  title  = {DCMM-Transformer: Degree-Corrected Mixed-Membership Attention for Medical Imaging},
  author = {Huimin Cheng and Xiaowei Yu and Shushan Wu and Luyang Fang and Chao Cao and Jing Zhang and Tianming Liu and Dajiang Zhu and Wenxuan Zhong and Ping Ma},
  journal= {arXiv preprint arXiv:2511.12047},
  year   = {2025}
}