RoboSurg-VQA:针对外科分割感知的视觉问答基准
计算机视觉与模式识别
2026-05-25 v1
摘要
可靠的视觉理解在机器人辅助和 minimally invasive 手术 (RMIS/MIS) 中,需要不仅仅是准确的掩码:在临床实践中,医生会提出关于程序背景、可见性、器具和解剖结构的语言似问题,常常面临因遮挡、烟雾、出血和光斑引起的视角降低。我们提出 RoboSurg-VQA,一个分割感知的视觉问答 (VQA) 基准,通过在共享模式下改造公共外科分割数据集构建而来。每帧配对固定的一组临床动机问题,涵盖程序背景、解剖结构(包括区域)、成像模态/视图、手术器具、图像质量以及基本可见性和空间属性,采用封闭式答案集合以实现一致评估。为扩大标注规模,我们通过受约束的提示生成候选答案,进行自动有效性和一致性检查,然后进行人工审核以提高可信度和标签一致性。我们报告基准统计数据、合理基线和在挑战性外科条件下的常见评估挑战。代码将在 https://github.com/ziyangwang007/Robosurg-VQA 提供。
引用
@article{arxiv.2605.23068,
title = {RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering},
author = {Chengyi Zhang and Zi Ye and Ziyang Wang},
journal= {arXiv preprint arXiv:2605.23068},
year = {2026}
}