中文

Video-TransUNet:用于CT VFSS实例分割的时间混合视觉Transformer

图像与视频处理 2022-08-23 v3 计算机视觉与模式识别

摘要

我们提出Video-TransUNet,一种通过将时间特征混合集成到TransUNet深度学习框架中而构建的医学CT视频实例分割深度架构。具体而言,我们的方法融合了通过ResNet CNN骨干网的强帧表示、通过时间上下文模块(TCM)的多帧特征混合、通过Vision Transformer的非局部注意力,以及通过带多个头的基于UNet的卷积-反卷积架构对多目标的重建能力。我们表明,在Videofluoroscopic Swallowing Study(VFSS)CT序列的食团与咽/喉分割测试上,这一新网络设计可显著优于其他SOTA系统。在我们的VFSS2022数据集上,其达到0.8796的Dice系数与1.0379像素的平均表面距离。需注意,准确追踪咽食团在临床实践中尤为重要,因其构成吞咽障碍诊断的主要方法。我们的发现表明,所提模型确实可通过利用时间信息并大幅改善分割性能来增强TransUNet架构。我们发布了关键源代码、网络权重与真值标注以简化性能复现。

关键词

引用

@article{arxiv.2208.08315,
  title  = {Video-TransUNet: Temporally Blended Vision Transformer for CT VFSS Instance Segmentation},
  author = {Chengxi Zeng and Xinyu Yang and Majid Mirmehdi and Alberto M Gambaruto and Tilo Burghardt},
  journal= {arXiv preprint arXiv:2208.08315},
  year   = {2022}
}

备注

Accepted by International Conference on Machine Vision 2022