医学图像分割中视觉Transformer的近期综述
图像与视频处理
2023-12-20 v2 计算机视觉与模式识别
摘要
医学图像分割在各种医疗应用中起着关键作用,可实现准确诊断、治疗规划和疾病监测。传统上,卷积神经网络(CNNs)主导该领域,擅长局部特征提取。然而,其在捕捉图像区域间长程依赖方面的局限,给分割医学数据中常见的复杂互连结构带来挑战。近年来,视觉Transformer(ViTs)已成为应对医学图像分割挑战的有前景技术。其多尺度注意力机制能有效建模远距离结构间的长程依赖,这对分割跨越图像的细胞器或病灶至关重要。此外,ViTs 辨别细微模式异质性的能力可精确勾画复杂边界与边缘,这是准确医学图像分割的关键方面。但它们确实缺乏图像相关的归纳偏置与平移不变性,可能影响性能。近期,研究者提出多种在架构中融入 CNNs 的 ViT 基方法,称为混合视觉Transformer(HVTs),以在获取图像全局信息之外捕捉局部关联。本综述详细回顾了 ViTs 与 HVTs 在医学图像分割中的最新进展。除对基于 ViT 与 HVT 的医学图像分割方法分类外,我们还详述其在多种医学图像模态中的实时应用。本综述可作为研究人员、医疗从业者及学生理解 ViT 基医学图像分割前沿方法的宝贵资源。
引用
@article{arxiv.2312.00634,
title = {A Recent Survey of Vision Transformers for Medical Image Segmentation},
author = {Asifullah Khan and Zunaira Rauf and Abdul Rehman Khan and Saima Rathore and Saddam Hussain Khan and Najmus Saher Shah and Umair Farooq and Hifsa Asif and Aqsa Asif and Umme Zahoora and Rafi Ullah Khalil and Suleman Qamar and Umme Hani Asif and Faiza Babar Khan and Abdul Majid and Jeonghwan Gwak},
journal= {arXiv preprint arXiv:2312.00634},
year = {2023}
}