SurgLQA:可扩展的长时程外科视频问答
计算机视觉与模式识别
2026-05-19 v1
摘要
外科视频问答(VideoQA)为动态手术期解释提供了有前景的范式,使其能够在临床环境中实现实时决策支持和上下文感知检索。然而,现有方法主要局限于图像或短片段,限制了其建模长范围程序动态和跨扩展手术工作流程中因果依赖关系的能力。为解决这一挑战,我们提出了 SurgLQA,一个用于可扩展外科推理的统一长时程 VideoQA 框架。该框架集成了可靠时间整合(FTC),该方法利用内在时间线索构建紧凑的长期表示,同时保持细粒度的时间保真度。进一步,我们开发了时空 grounding 多策略扩展(TMS),这是一种在时空 grounding 上下文中战略性调整策略级别推理容量的自适应测试时期间推理范式。为 facilitate 系统评估,我们重新结构化了一个持续时间较长的结肠镜 VideoQA 基准,Colon-LQA,并在 Colon-LQA 和 REAL-Colon-VQA 上进行大量实验。实验结果表明,我们的方法在时空 grounding 推理中实现了一致的性能提升。代码链接: https://github.com/RascalGdd/SurgLQA。
引用
@article{arxiv.2605.17915,
title = {SurgLQA: Scalable Long-Horizon Surgical Video Question Answering},
author = {Diandian Guo and Xikai Yang and Ruiyang Li and Jialun Pei and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2605.17915},
year = {2026}
}
备注
MICCAI 2026 Early Accept