基于层次预训练的EndoMamba:面向内窥镜视频的高效基础模型
计算机视觉与模式识别
2025-05-16 v2
摘要
内窥镜视频任务,如视觉导航和手术阶段识别,在 minimally invasive手术中发挥着关键作用,为提供实时辅助。尽管最近的视频基础模型显示出前景,但其应用受到(1)计算效率不足和(2)由于内窥镜数据有限导致的次优性能的限制。为此,我们提出EndoMamba,一种为实时推断而设计的基础模型,能够学习通用的时空表示。首先,为缓解计算效率不足,我们提出EndoMamba backbone,针对实时推断进行优化。灵感来自最新进展的状态空间模型,EndoMamba集成了用于单个帧内空间建模的双向Mamba块,以及用于过去到现在时序推理的普通Mamba块。这一设计既实现了强大的时空建模,又实现了在在线视频流中的高效推断。其次,我们提出一种自监督层次预训练图谱,以增强EndoMamba的表示学习,同时利用内窥镜视频并融合一般视频领域知识。具体而言,我们的方法结合掩码重建和辅助监督,利用低层重建捕获时空结构,利用高层对齐来传递来自预训练通用视频基础模型的更广泛知识。在四个下游任务上的大量实验表明,EndoMamba在保持实时推断速度的同时,超过了现有基础模型和任务特定方法。该项目代码已公开于https://github.com/TianCuteQY/EndoMamba。
引用
@article{arxiv.2502.19090,
title = {EndoMamba: An Efficient Foundation Model for Endoscopic Videos via Hierarchical Pre-training},
author = {Qingyao Tian and Huai Liao and Xinyan Huang and Bingyu Yang and Dongdong Lei and Sebastien Ourselin and Hongbin Liu},
journal= {arXiv preprint arXiv:2502.19090},
year = {2025}
}