SG2VID:场景图实现视频合成的细粒度控制
计算机视觉与模式识别
2025-06-16 v2
摘要
外科模拟在训练新手外科医生、加速其学习曲线以及减少术中错误方面发挥着关键作用。然而,传统的模拟工具无法提供必要的真实感和人体解剖结构的变异性。为此,当前的方法正转向基于生成模型的模拟器。然而,这些方法主要侧重于使用日益复杂的条件进行精确合成,却忽略了细粒度的人工控制方面。为了填补这一空白,我们引入了 SG2VID,这是首个利用场景图进行精确视频合成与细粒度人工控制的基于扩散的视频模型。我们在包含白内障和胆囊切除术手术的三个公开数据集上展示了 SG2VID 的能力。SG2VID 不仅在定性和定量上均优于先前的方法,还实现了精确合成,提供了对工具与解剖结构的大小和运动、新工具的进入以及整体场景布局的精确控制。我们通过定性分析说明了 SG2VID 如何用于生成式数据增强,并展示了一项实验,证明当使用我们的合成视频扩展训练集时,其能够提升下游阶段检测任务的性能。最后,为了展示 SG2VID 保留人工控制的能力,我们通过交互场景图生成了描绘重大但罕见术中异常的新视频样本。
引用
@article{arxiv.2506.03082,
title = {SG2VID: Scene Graphs Enable Fine-Grained Control for Video Synthesis},
author = {Ssharvien Kumar Sivakumar and Yannik Frisch and Ghazal Ghazaei and Anirban Mukhopadhyay},
journal= {arXiv preprint arXiv:2506.03082},
year = {2025}
}