中文

Hi-End-MAE:基于层次化编码器驱动的掩码自编码器是医学图像分割中更强大的视觉学习器

计算机视觉与模式识别 2025-02-13 v1

摘要

医学图像分割因标签稀缺而 remains a formidable challenge。通过在大规模无标签医学数据集上通过掩码图像建模 (MIM) 进行 ViT 预训练,为各种下游任务提供计算效率和模型泛化能力,这是一条有前景的解决方案。然而,当前的 ViT-based MIM 预训练框架主要强调输出层的局部聚合表示,未能利用跨不同 ViT 层丰富的表示,这些表示更能捕捉所需精细语义信息以实现更精确的医学下游任务。为填补此空白,我们提出了基于层次化编码器驱动的 MAE (Hi-End-MAE),这是一种简单而有效的 ViT 预训练方案,核心创新点包括:(1) 编码器驱动的重建,鼓励编码器学习更具信息性的特征以指导掩码块的重建;(2) 层次化稠密解码,实现跨不同层的层次化解码结构以捕获丰富的表示。我们在 1 万块 CT 扫描的数据集上对 Hi-End-MAE 进行预训练,并在七个公开医学图像分割基准测试中评估其性能。大量实验表明,Hi-End-MAE 在各种下游任务中展现出卓越的迁移学习能力,揭示了 ViT 在医学影像中的潜力。代码已公开:https://github.com/FengheTan9/Hi-End-MAE

关键词

引用

@article{arxiv.2502.08347,
  title  = {Hi-End-MAE: Hierarchical encoder-driven masked autoencoders are stronger vision learners for medical image segmentation},
  author = {Fenghe Tang and Qingsong Yao and Wenxin Ma and Chenxu Wu and Zihang Jiang and S. Kevin Zhou},
  journal= {arXiv preprint arXiv:2502.08347},
  year   = {2025}
}

备注

19 pages, Code: https://github.com/FengheTan9/Hi-End-MAE