SWoMo:针对白内障手术模拟的神经符号世界模型
计算机视觉与模式识别
2026-05-21 v2
摘要
真实的手术模拟在培训初学生外科医生和开发自主代理人方面发挥着关键作用。世界模型可以通过预测当前观察和手术动作条件下的未来患者状态,从而将此类模拟环境扩展到真实且多样化的程序。然而,当前的先进方法往往无法满足临床可行性所需的关键标准,包括视觉逼真度、基于物理的交互,以及能够模拟训练分布之外的情景的能力。因此,我们引入SWoMo,一种用于白内障手术模拟的神经符号世界模型,通过分离运动生成与视觉逼真度来实现目标。符号组件由基于规则的模拟器和场景图表示组成,建模运动动力学和工具-组织相互作用,而扩散模型则生成真实的视觉外观,包括纹理和组织变形。我们提出了一种逆向配对策略,在模拟器中重建真实手术视频,以获得配对的模拟和真实视频,然后用于训练视频扩散模型,以实现模拟到真实的翻译的反目标。我们的实验显示,与先前工作相比,SWoMo在定性和定量方面都实现了显著的改进。我们进一步表明,仿真器满足了关键标准,包括对未见的交互几何的泛化、下游阶段检测的改进,以及无监督视频风格迁移。代码、数据和模型权重均可在:https://ssharvienkumar.github.io/SWoMo/ 获取。
引用
@article{arxiv.2605.16530,
title = {SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation},
author = {Ssharvien Kumar Sivakumar and Akwele Johnson and Anirudh Dhingra and Yannik Frisch and Ghazal Ghazaei and Anirban Mukhopadhyay},
journal= {arXiv preprint arXiv:2605.16530},
year = {2026}
}