Vivim:一种用于医学视频分割的视频视觉 Mamba
计算机视觉与模式识别
2024-08-02 v4
摘要
由于视频帧中冗余的动态参考信息,医学视频分割在临床实践中日益受到关注。然而,传统的卷积神经网络感受野有限,而基于 Transformer 的网络在计算复杂度方面构建长程依赖关系的能力平庸。这一瓶颈在使用内存有限的可用设备处理医学视频分析任务中的较长序列时,构成了重大挑战。最近,以 Mamba 闻名的状态空间模型(SSMs)在高效长序列建模方面取得了令人瞩目的成就,通过显著扩展许多视觉任务上的感受野来发展深度神经网络。不幸的是,原始的 SSMs 未能同时捕捉因果时序线索并保留非因果空间信息。为此,本文提出了一种基于视频视觉 Mamba 的框架,称为 Vivim,用于医学视频分割任务。我们的 Vivim 能够通过我们设计的时序 Mamba 块,有效地将长程时空表示压缩为不同尺度的序列。我们还引入了一种改进的跨帧边界感知仿射约束,以增强 Vivim 对模糊病变的判别能力。在甲状腺分割、超声视频乳腺病变分割和结肠镜视频息肉分割上的大量实验证明了我们 Vivim 的有效性和效率,优于现有方法。代码可在以下地址获取:https://github.com/scott-yjyang/Vivim。数据集将在接收后发布。
引用
@article{arxiv.2401.14168,
title = {Vivim: a Video Vision Mamba for Medical Video Segmentation},
author = {Yijun Yang and Zhaohu Xing and Lequan Yu and Chunwang Huang and Huazhu Fu and Lei Zhu},
journal= {arXiv preprint arXiv:2401.14168},
year = {2024}
}