ResViT:用于多模态医学图像合成的残差视觉Transformer
图像与视频处理
2022-07-21 v3 计算机视觉与模式识别
摘要
具有卷积神经网络(CNN)主干的生成对抗模型近来已在众多医学图像合成任务中被确立为最先进水平。然而,CNN旨在以紧凑滤波器进行局部处理,这种归纳偏置损害了上下文特征的学习。在此,我们提出一种用于医学图像合成的新颖生成对抗方法 ResViT,其利用了视觉Transformer的上下文敏感性、卷积算子的精确性以及对抗学习的真实感。ResViT的生成器采用一个由新颖的聚合残差Transformer(ART)块组成的核心瓶颈,这些块协同结合残差卷积模块与Transformer模块。ART块中的残差连接促进了所捕获表示的多样性,而通道压缩模块提炼与任务相关的信息。在ART块之间引入权重共享策略以减轻计算负担。引入统一实现以避免针对不同的源-目标模态配置重新构建独立的合成模型。针对多对比度MRI中缺失序列的合成以及由MRI合成CT图像进行了全面演示。我们的结果表明,在定性观察与定量指标方面,ResViT优于基于CNN和基于Transformer的竞争性方法。
引用
@article{arxiv.2106.16031,
title = {ResViT: Residual vision transformers for multi-modal medical image synthesis},
author = {Onat Dalmaz and Mahmut Yurt and Tolga Çukur},
journal= {arXiv preprint arXiv:2106.16031},
year = {2022}
}