ViT-V-Net:用于无监督三维医学图像配准的视觉Transformer
图像与视频处理
2021-04-15 v1 计算机视觉与模式识别
摘要
在过去十年中,卷积神经网络(ConvNets)已在多种医学影像应用中占据主导并取得最先进性能。然而,ConvNets的性能仍受限于缺乏对图像中长程空间关系的理解。近期提出的用于图像分类的Vision Transformer(ViT)使用纯基于自注意力的模型,学习长程空间关系以关注图像的相关部分。不过,ViT因连续下采样强调低分辨率特征,导致缺乏精细定位信息,使其不适用于图像配准。最近,若干基于ViT的图像分割方法已与ConvNets结合以改善精细定位信息的恢复。受此启发,我们提出ViT-V-Net,其桥接ViT与ConvNet以提供三维医学图像配准。此处呈现的实验结果表明,所提架构取得了优于若干顶尖配准方法的性能。
引用
@article{arxiv.2104.06468,
title = {ViT-V-Net: Vision Transformer for Unsupervised Volumetric Medical Image Registration},
author = {Junyu Chen and Yufan He and Eric C. Frey and Ye Li and Yong Du},
journal= {arXiv preprint arXiv:2104.06468},
year = {2021}
}