中文

3D Shuffle-Mixer:一种用于医学体数据密集预测的 Transformer-MLP 范式高效上下文感知视觉学习器

计算机视觉与模式识别 2022-04-15 v1 人工智能

摘要

医学体数据中的密集预测为临床分析提供了丰富的指导。由于缺乏长程依赖和全局上下文建模能力,CNN 骨干网络已遇到瓶颈。近期工作提出将视觉 transformer 与 CNN 结合,因其具有强大的全局捕捉能力和学习能力。然而,大多数工作仅限于简单应用纯 transformer,存在若干致命缺陷(即缺乏归纳偏置、计算量大以及对 3D 数据考虑不足)。因此,为医学体数据密集预测设计一种优雅高效的视觉 transformer 学习器既具前景又富挑战。本文提出一种新颖的 3D Shuffle-Mixer 网络,采用一种新的局部视觉 Transformer-MLP 范式用于医学密集预测。在我们的网络中,利用局部视觉 transformer 模块对重排体数据的全视角切片进行打乱并学习空间上下文;设计残差轴向 MLP 以切片感知方式混合并捕捉剩余体数据上下文;采用 MLP 视角聚合器以视角感知方式将学到的全视角丰富上下文投影到体特征中。此外,提出自适应缩放增强捷径以增强局部视觉 transformer 沿空间和通道维度的特征,并提出 CrossMerge 在金字塔架构中适当跳跃连接多尺度特征。大量实验表明,所提模型优于其他最先进的医学密集预测方法。

关键词

引用

@article{arxiv.2204.06779,
  title  = {3D Shuffle-Mixer: An Efficient Context-Aware Vision Learner of Transformer-MLP Paradigm for Dense Prediction in Medical Volume},
  author = {Jianye Pang and Cheng Jiang and Yihao Chen and Jianbo Chang and Ming Feng and Renzhi Wang and Jianhua Yao},
  journal= {arXiv preprint arXiv:2204.06779},
  year   = {2022}
}