超出可见范围: 基于代理动态图的遮挡感知编辑
计算机视觉与模式识别
2025-12-17 v2
摘要
我们解决图像到视频生成中对最终帧遮挡区域实现显式用户控制的问题。当前的图像到视频管道会产生合理的运动,但难以在新暴露区域生成可预测且可操控的运动,同时强制用户指定的内容。我们的关键思想是将运动指定与外观合成分离:我们引入一种轻量级、可编辑的代理动态图(PDG),其可确定性地(尽管近似地)驱动部分运动,而冻结的扩散先验用于合成符合该运动的合理外观。在我们的训练自由管道中,用户松�标注和重新定位 PDG,从而计算出稠密运动流以利用扩散作为运动导向的着色器。随后,用户编辑遮挡区域的外观,并利用 PDG 编码的可见性信息执行潜在空间的复合,将运动与用户意图在这些区域内协调。该设计实现了可控的关节运动和对遮挡区域的用户控制,无需微调。我们在针对图像生成短时关节物体、家具、车辆和可变形物体的视频方面,明显优于最先进的替代方案。我们的方法将生成式控制(以松散姿态和结构形式)与可预测控制(以最终帧遮挡区域外观指定形式)相结合,开辟了新的图像到视频工作流程。代码将在接受后发布。项目页面: https://anranqi.github.io/beyond-visible.github.io/
引用
@article{arxiv.2512.13392,
title = {Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs},
author = {Anran Qi and Changjian Li and Adrien Bousseau and Niloy J. Mitra},
journal= {arXiv preprint arXiv:2512.13392},
year = {2025}
}