中文

SAW:通过可控可扩展视频生成的外科行动世界模型

计算机视觉与模式识别 2026-03-16 v1 人工智能 机器学习 图像与视频处理

摘要

具备生成具有精确控制器械-组织相互作用的逼真外科行动视频的外科世界模型,可从数据稀缺、稀有事件合成到弥合仿真与现实之间的 sim-to-real 差距,解决外科 AI 和自动化的根本性挑战。然而,当前视频生成方法——即此类外科世界模型的核心——在推理时需要昂贵的标注或复杂的结构化中间信号,限制了其可扩展性。其他方法在复杂腹腔场景中表现出有限的时序一致性,且缺乏足够的真实感。我们提出了外科行动世界模型(SAW)——通过基于四种轻量级信号的视频扩散条件化方法,实现外科行动世界建模:编码器械-行动语境的语言提示、参考外科场景、组织可达性掩码以及 2D 器械针尖轨迹。我们设计了条件视频扩散方法,将视频到视频扩散重新表述为轨迹条件化的外科行动合成。扩散模型的主干网络在由 12,044 条腹腔镜短片组成的自定义精选数据集上进行微调,利用深度一致性损失在不需深度信息的情况下强制几何可行性。SAW 在 held-out 测试数据上实现了最先进的时序一致性(CD-FVD:199.19 vs. 546.82)和强烈的视觉质量。进一步,我们展示了其下游应用:(a) 外科 AI,其中利用 SAW 生成的视频增强稀有行动识别(实测数据 F1 分数:20.93% 提升至 43.14%;切割类:0.00% 提升至 8.33%),以及 (b) 外科仿真,其中基于仿真器导出的轨迹点渲染器械-组织交互视频,以实现视觉上忠实的仿真引擎。

关键词

引用

@article{arxiv.2603.13024,
  title  = {SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation},
  author = {Sampath Rapuri and Lalithkumar Seenivasan and Dominik Schneider and Roger Soberanis-Mukul and Yufan He and Hao Ding and Jiru Xu and Chenhao Yu and Chenyan Jing and Pengfei Guo and Daguang Xu and Mathias Unberath},
  journal= {arXiv preprint arXiv:2603.13024},
  year   = {2026}
}

备注

The manuscript is under review