外科医生离手术世界模型有多远?——基于专家评估的零样手术视频生成试点研究
计算机视觉与模式识别
2025-11-04 v1 人工智能
多媒体
摘要
基础模型在视频生成方面正显示出强大的能力,作为模拟物理世界的世界模型。然而,其在高风险领域如手术领域的应用仍是关键未探索的空白,这些领域需要深入、专业的因果知识,而不仅仅是通用物理规则。为系统性地解决这一挑战,我们提出 SurgVeo,这是首个为手术视频生成模型评估而构建的专家精选基准测试,以及 Surgical Plausibility Pyramid (SPP),这是一种新颖的四层次框架,用于评估模型输出,从基本外观到复杂手术策略。基于 SurgVeo 基准,我们让高级 Veo-3 模型对 laparoscopic 和 neurosurgical 手术片段进行零样预测。四位资质外科医生根据 SPP 评估生成的视频。我们的结果揭示了明显的“合理性差距”:尽管 Veo-3 在视觉感知合理性方面取得卓越成绩,但在 SPP 的更高层次(包括器械操作合理性、环境反馈合理性和手术意图合理性)方面仍显著不足。这项工作提供了手术 AI 中从视觉逼真模仿到因果理解之间鸿沟的首个定量证据。SurgVeo 和 SPP 的发现为开发能够导航专业现实医疗领域复杂性的未来模型奠定了关键基础并提供了路线图。
引用
@article{arxiv.2511.01775,
title = {How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment},
author = {Zhen Chen and Qing Xu and Jinlin Wu and Biao Yang and Yuhao Zhai and Geng Guo and Jing Zhang and Yinlu Ding and Nassir Navab and Jiebo Luo},
journal= {arXiv preprint arXiv:2511.01775},
year = {2025}
}