EfficientMorph:用于 3D 图像配准的参数高效 Transformer 架构
计算机视觉与模式识别
2024-12-03 v2
摘要
Transformer 已成为医学图像配准中最先进的架构,通过解决卷积神经网络(CNN)有限的感受野并克服更深模型中的梯度不稳定性,其表现优于 CNN。尽管取得了成功,但基于 Transformer 的模型在训练时需要大量资源,包括数据、内存和计算能力,这可能限制了其在资源有限的最终用户中的适用性。特别是,现有的基于 Transformer 的 3D 图像配准架构面临两个挑战其效率和有效性的关键缺口。首先,尽管基于窗口的注意力机制通过聚焦局部区域降低了全注意力的二次复杂度,但它们通常难以有效整合局部和全局信息。其次,分词的粒度是影响配准精度的关键因素,呈现出一种性能权衡:更小的体素尺寸分词能增强细节捕捉,但伴随着计算复杂度增加、内存使用量上升以及更大的过拟合风险。我们提出了 \name,一种用于无监督 3D 图像配准的基于 Transformer 的架构,它通过基于平面的注意力机制平衡 3D 体积中的局部和全局注意力,并采用带有合并操作的高分辨率分词策略,从而在不牺牲计算效率的情况下捕捉更精细的细节。值得注意的是,\name 在 OASIS 数据集上以少 16-27 倍的参数量创造了性能的新基准。https://github.com/MedVIC-Lab/Efficient_Morph_Registration
关键词
引用
@article{arxiv.2403.11026,
title = {EfficientMorph: Parameter-Efficient Transformer-Based Architecture for 3D Image Registration},
author = {Abu Zahid Bin Aziz and Mokshagna Sai Teja Karanam and Tushar Kataria and Shireen Y. Elhabian},
journal= {arXiv preprint arXiv:2403.11026},
year = {2024}
}
备注
*Equal Contribution, **Corresponding Author