SurgVidLM:基于大型语言模型的多粒度手术视频理解
计算机视觉与模式识别
2026-02-04 v3 人工智能
摘要
手术场景理解对于机器人辅助手术中的手术训练和机器人决策至关重要。多模态大型语言模型(Multimodal Large Language Models, MLLMs)的最新进展展示了在推进医学领域场景感知方面的巨大潜力,有助于外科医生理解手术场景和程序。然而,这些方法主要面向基于图像的分析或全局视频理解,忽略了对分析特定过程和捕捉手术程序内详细任务执行至关重要的细粒度视频推理。为了弥合这一差距,我们提出了 SurgVidLM,这是第一个旨在解决完整和细粒度手术视频理解的视频语言模型。为了训练 SurgVidLM,我们构建了 SVU-31K,这是一个包含超过 31K 视频-指令对的大规模数据集,能够对手术程序进行整体理解和详细分析。在此资源的基础上,SurgVidLM 结合了两阶段的 StageFocus 机制:第一阶段提取全局程序上下文,而第二阶段在时间线索的引导下执行高频局部分析。我们还开发了多频率融合注意力,以有效整合低频和高频视觉 token,确保保留关键的任务特定细节。实验结果表明,SurgVidLM 在完整和细粒度视频理解任务中均显著优于具有可比参数规模的最先进的 Vid-LLMs,展示了其在捕捉复杂机器人辅助手术上下文方面的卓越能力。我们的代码和数据集将很快公开。
引用
@article{arxiv.2506.17873,
title = {SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model},
author = {Guankun Wang and Junyi Wang and Wenjin Mo and Long Bai and Kun Yuan and Ming Hu and Jinlin Wu and Junjun He and Yiming Huang and Nicolas Padoy and Zhen Lei and Hongbin Liu and Nassir Navab and Hongliang Ren},
journal= {arXiv preprint arXiv:2506.17873},
year = {2026}
}