OR-VSKC:通过合成数据引导的运动室视觉-语义知识冲突解决
计算机视觉与模式识别
2026-05-01 v2 人工智能
摘要
自动识别手术安全风险对于改善患者预后至关重要;然而,多模态大语言模型(MLLM)常常 suffer from Visual-Semantic Knowledge Conflicts (VS-KC),即模型拥有安全知识但在视觉检查时未能激活它。研究这一运动室(OR)中的对齐差距受到了关键瓶颈的制约: depict safety violations 的真实世界 OR 数据稀缺且受隐私限制。为此,我们提出 OR-VSKC,一个用于研究 VS-KC 和手术风险感知的基准测试,专用于受严格监管的 OR 环境。通过我们的 Protocol-to-Pixel 生成式框架构建的 OR-VSKC 包括 28,190 张基于权威安全标准构建的高保真合成图像,以及由 713 张专家编写的挑战子集,经多位专家验证。完整的基准测试数据源自 4D-OR 和 CAMMA-MVOR 数据集,其中 4D-OR 基于的部分作为主要基准核心,CAMMA-MVOR 基于的部分用于外部验证和跨数据集泛化分析。对最先进的 MLLM 进行评估显示,即使在领先的通用型模型中也存在显著的可靠性差距。此外,实验表明,在 OR-VSKC 上进行微调有效缓解了 VS-KC,使模型能够对 unseen camera viewpoints 实现稳健的泛化。我们开源代码和数据集以支持医疗环境中可重复的研究。源代码地址为 https://github.com/zgg2577/VS-KC。
引用
@article{arxiv.2506.22500,
title = {OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment},
author = {Weiyi Zhao and Xiaoyu Tan and Liang Liu and Sijia Li and Youwei Song and Xihe Qiu},
journal= {arXiv preprint arXiv:2506.22500},
year = {2026}
}
备注
13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC