中文

SurgSora:面向可控手术视频生成的物体感知扩散模型

计算机视觉与模式识别 2025-06-24 v3 人工智能 多媒体 机器人学

摘要

手术视频生成能够促进医学教育与研究,但现有方法缺乏细粒度的运动控制与真实感。我们提出 SurgSora,一个从单张输入帧与用户指定的运动线索生成高保真、运动可控手术视频的框架。与先前不加区分地处理物体或依赖真值分割掩码的方法不同,SurgSora 利用自预测的物体特征与深度信息来精化 RGB 外观与光流,从而实现精确的视频合成。它由三个关键模块组成:(1) 双语义注入器,提取物体特定的 RGB-D 特征与分割线索以增强空间表征;(2) 解耦光流映射器,将多尺度光流与语义特征融合以实现真实的运动动力学;(3) 轨迹控制器,估计稀疏光流并支持用户引导的物体运动。通过在 Stable Video Diffusion 中以这些增强特征为条件,SurgSora 在推进手术视频合成方面达到了 SOTA 的视觉真实感与可控性,这一点通过广泛的定量与定性比较得到了验证。我们与专家外科医生合作开展的人工评估进一步证明了 SurgSora 生成视频的高度真实感,凸显了该方法在手术培训与教育中的潜力。项目页面见 https://surgsora.github.io/surgsora.github.io。

关键词

引用

@article{arxiv.2412.14018,
  title  = {SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation},
  author = {Tong Chen and Shuya Yang and Junyi Wang and Long Bai and Hongliang Ren and Luping Zhou},
  journal= {arXiv preprint arXiv:2412.14018},
  year   = {2025}
}

备注

MICCAI 2025