SurgTEMP:面向腹腔动脉切除术的时序感知外科视频问答中的文本引导视觉记忆
计算机视觉与模式识别
2026-05-05 v3
摘要
外科手术本质上复杂且充满风险,需要大量专业知识和持续注意力以应对手术中不断变化的场景。计算机辅助系统,如外科视觉问答(VQA),为教育和手术期间支持提供了巨大的希望。当前的外科VQA研究主要关注静态帧分析,忽略了丰富的时序语义。外科视频问答还面临视觉对比度低、高度知识驱动、需求多样化(涉及分散的时序窗口)以及从基础感知到高级手术评估的层级结构等挑战。为此,我们提出SurgTEMP,一种多模态大语言模型框架,包含(i)查询引导的token选择模块,用于构建层次化视觉记忆(空间记忆库和时序记忆库),以及(ii)外科能力进展(Surgical Competency Progression, SCP)训练方案。二者共同实现了对可变长度手术视频的有效建模,同时保留与手术相关的线索和时序一致性,更好地支持多样化的下游评估任务。为支持模型开发,我们引入CholeVidQA-32K数据集,包含32K个开放式问答对和3,855个视频片段(总时长约128小时),来自腹腔动脉切除术。该数据集按三个层级结构组织——感知、评估和推理——覆盖11项任务,从仪器/动作/解剖感知到临界安全观察(Critical View of Safety, CVS)、手术困难、技能熟练度和不良事件评估。通过对当前主流开源多模态和视频LLM(微调和零样本)进行全面评估,SurgTEMP实现了显著的性能提升,推动了基于视频的外科VQA技术发展。项目页面地址:https://camma-public.github.io/SurgTEMP/
引用
@article{arxiv.2603.29962,
title = {SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy},
author = {Shi Li and Vinkle Srivastav and Nicolas Chanel and Saurav Sharma and Nabani Banik and Lorenzo Arboit and Kun Yuan and Pietro Mascagni and Nicolas Padoy},
journal= {arXiv preprint arXiv:2603.29962},
year = {2026}
}
备注
29 pages, 14 figures, 9 tables