中文

TranSiam:利用 Transformer 融合多模态视觉特征用于医学图像分割

计算机视觉与模式识别 2022-04-27 v1

摘要

基于多模态的医学图像自动分割是疾病诊断中的重要课题。尽管卷积神经网络(CNN)已被证明在图像分割任务中具有优异性能,但其难以获取全局信息。全局信息的缺失将严重影响病灶区域分割结果的准确性。此外,同一患者的多模态数据之间存在视觉表示差异。这些差异会影响自动分割方法的结果。为解决这些问题,我们提出了一种适用于多模态医学图像、能够捕获全局信息的分割方法,名为 TranSiam。TranSiam 是一个提取不同模态特征的二维双路径网络。在每条路径中,我们利用卷积在低层阶段提取细节信息,并设计了一个 ICMT 块在高阶阶段提取全局信息。ICMT 块将卷积嵌入 transformer 中,能够在保留空间与细节信息的同时提取全局信息。此外,我们设计了一种基于交叉注意力与自注意力的新颖融合机制,称为 TMM 块,可有效融合不同模态间的特征。在 BraTS 2019 与 BraTS 2020 多模态数据集上,我们的准确率较其他流行方法有明显提升。

关键词

引用

@article{arxiv.2204.12185,
  title  = {TranSiam: Fusing Multimodal Visual Features Using Transformer for Medical Image Segmentation},
  author = {Xuejian Li and Shiqiang Ma and Jijun Tang and Fei Guo},
  journal= {arXiv preprint arXiv:2204.12185},
  year   = {2022}
}