Video-SwinUNet:用于VFSS实例分割的时空深度学习框架
计算机视觉与模式识别
2024-02-13 v2 人工智能
摘要
本文提出一种用于医学视频分割的深度学习框架。卷积神经网络(CNN)和基于Transformer的方法凭借其卓越的语义特征编码与全局信息理解能力,在医学图像分割任务中取得了重大进展。然而,大多数现有方法忽略了一个医学视频数据的重要方面——时间维度。我们提出的框架显式地从时间维度上的相邻帧提取特征,并通过时间特征混合器将其融合,随后将高层时空特征令牌化,形成经Swin Transformer编码的强全局特征。最终的分割结果由类UNet的编码器-解码器架构生成。我们的模型以显著优势超越其他方法,并提升了VFSS2022数据集上的分割基准,在两个测试数据集上分别取得了0.8986和0.8186的Dice系数。我们的研究还显示了时间特征混合方案的有效性以及所学能力的跨数据集可迁移性。代码与模型已完整发布于https://github.com/SimonZeng7108/Video-SwinUNet。
引用
@article{arxiv.2302.11325,
title = {Video-SwinUNet: Spatio-temporal Deep Learning Framework for VFSS Instance Segmentation},
author = {Chengxi Zeng and Xinyu Yang and David Smithard and Majid Mirmehdi and Alberto M Gambaruto and Tilo Burghardt},
journal= {arXiv preprint arXiv:2302.11325},
year = {2024}
}