SurgAnt-ViVQA:通过基于 GRU 的时序跨注意力学习预测手术事件
计算机视觉与模式识别
2025-11-06 v1
摘要
预测未来手术事件对于在后鼻腔 transsphenoidal 島底手术中提供实时辅助至关重要,因为该手术的可视范围受限且工作流程快速变化。大多数视觉问答(VQA)系统仅针对单个画面进行推理,静态地进行视觉-语言对齐,难以支持对后续步骤或器械需求的预测。现有的手术 VQA 数据集也集中于当前场景而非近期未来。我们引入 PitVQA-Anticipation,这是第一个为前瞻性手术推理设计的 VQA 数据集。它包含 33.5 小时的手术视频和 734,769 对问答对,基于按时间分组的短片和专家注释构建,覆盖四个任务:预测未来阶段、下一步、即将到来的器械以及剩余时间。我们进一步提出 SurgAnt-ViVQA,一种采用 GRU 驱动的时序跨注意力模块的视频语言模型。双向 GRU 编码帧与帧之间的动态变化,while an adaptive gate 将视觉上下文在 token 级别注入语言流中。参数高效微调为手术领域定制语言主干。SurgAnt-ViVQA 在 PitVQA-Anticipation 和 EndoVis 数据集上测试,超越了强大的基于图像和视频的基线。消融实验表明,时序递归和门控融合是大部分提升的主要驱动力。帧预算研究表明:8 帧可最大化流畅度,而 32 帧虽略降低 BLEU 分数,但改善了数值时间估计。通过将时序感知编码器与细粒度门控跨注意力相结合,SurgAnt-ViVQA 将手术 VQA 从事后描述推进到主动预期。PitVQA-Anticipation 提供了该任务设置的全面基准,并凸显了针对可靠的、面向未来的手术辅助所需的针对性时序建模的重要性。
引用
@article{arxiv.2511.03178,
title = {SurgAnt-ViVQA: Learning to Anticipate Surgical Events through GRU-Driven Temporal Cross-Attention},
author = {Shreyas C. Dhake and Jiayuan Huang and Runlong He and Danyal Z. Khan and Evangelos B. Mazomenos and Sophia Bano and Hani J. Marcus and Danail Stoyanov and Matthew J. Clarkson and Mobarak I. Hoque},
journal= {arXiv preprint arXiv:2511.03178},
year = {2025}
}
备注
12 pages