SurgLLM:面向手术视频理解的具备空间聚焦与时序感知的通用大型多模态模型
计算机视觉与模式识别
2025-09-03 v1 人工智能
机器学习
摘要
手术视频理解对于促进计算机辅助手术(CAS)系统的发展至关重要。尽管已有研究取得了显著进展,但仍存在两个主要局限:即视觉内容感知不足以及手术视频时序感知不足,这些局限阻碍了通用CAS解决方案的开发。本文提出SurgLLM框架,是一个针对具备增强空间聚焦与时序感知的手术视频理解任务设计的有效大型多模态模型。具体而言,为提升手术视频的空间聚焦能力,本文首次构方手术情境感知多模态预训练(Surg-Pretrain)用于SurgLLM的视频编码器,通过进行仪器导向掩码视频重建(MV-Recon)并进行后续多模态对齐。为将手术时序知识融入SurgLLM,进一步提出时序感知多模态调优(TM-Tuning)以增强时序推理,运用交错的多模态嵌入。此外,为避免不同手术视频理解任务之间产生冲突,构方手术任务动态集成,以有效对查询进行分流,选取SurgLLM中最优的可学习参数。对多样化手术视频理解任务进行的广泛实验,包括描述生成、常规视觉问答和时序视觉问答,均显示出相较于最新方法显著的改进,验证了SurgLLM在通用手术视频理解方面的有效性。源代码已公开于 https://github.com/franciszchen/SurgLLM。
引用
@article{arxiv.2509.00357,
title = {SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding},
author = {Zhen Chen and Xingjian Luo and Kun Yuan and Jinlin Wu and Danny T. M. Chan and Nassir Navab and Hongbin Liu and Zhen Lei and Jiebo Luo},
journal= {arXiv preprint arXiv:2509.00357},
year = {2025}
}