中文

TransBTSV2:迈向更优且更高效的医学图像体分割

图像与视频处理 2022-05-18 v3 计算机视觉与模式识别

摘要

Transformer借助自注意力机制进行全局(长程)信息建模,近期在自然语言处理与计算机视觉中取得成功。卷积神经网络虽能捕捉局部特征,却难以从全局特征空间建模显式的长距离依赖。然而,局部与全局特征对稠密预测任务都至关重要,尤其对3D医学图像分割。本文进一步尝试在3D CNN中利用Transformer进行3D医学图像体分割,并基于编码器-解码器结构提出名为TransBTSV2的新网络。与TransBTS不同,所提TransBTSV2不局限于脑肿瘤分割(BTS),而聚焦于通用医学图像分割,为医学图像体分割提供更强且更高效的3D基线。作为CNN-Transformer混合架构,TransBTSV2无需任何预训练即可实现精准医学图像分割,兼具CNN的强归纳偏置与Transformer的强大全局上下文建模能力。通过重新设计Transformer块内部结构并提出可形变瓶颈模块以捕捉形状感知局部细节,我们获得了性能优越且高效的架构。在四个医学图像数据集(BraTS 2019、BraTS 2020、LiTS 2017与KiTS 2019)上的大量实验表明,TransBTSV2在脑肿瘤、肝脏肿瘤及肾脏肿瘤分割上取得了与最先进方法相当或更优的结果。代码将公开于https://github.com/Wenxuan-1119/TransBTS。

关键词

引用

@article{arxiv.2201.12785,
  title  = {TransBTSV2: Towards Better and More Efficient Volumetric Segmentation of Medical Images},
  author = {Jiangyun Li and Wenxuan Wang and Chen Chen and Tianxiang Zhang and Sen Zha and Jing Wang and Hong Yu},
  journal= {arXiv preprint arXiv:2201.12785},
  year   = {2022}
}