Follow-Your-Creation:通过视频填洞实现 4D 内容创作
计算机视觉与模式识别
2025-06-06 v1
摘要
我们提出了 Follow-Your-Creation,一个新颖的 4D 视频创作框架,能够从单目视频输入中生成和编辑 4D 内容。通过利用强大的视频填洞基础模型作为生成先验,我们将 4D 视频创作重新定义为视频填洞任务,使模型能够填补因相机轨迹变化或用户编辑而产生的缺失内容。为此,我们生成复合掩码填洞视频数据,以有效微调模型以适应 4D 视频生成。在给定输入视频及其关联相机轨迹后,我们首先进行基于深度的点云渲染,以获取指示应完成区域的不可见掩码。同时,引入编辑掩码以指定用户定义的修改,并将其与不可见掩码组合创建复合掩码数据集。在训练过程中,我们随机抽取不同类型的掩码以构建多样且具有挑战性的填洞场景,从而增强模型在各种 4D 编辑和生成任务中的泛化能力和鲁棒性。为处理大幅度相机运动下的时序一致性,我们设计了一种自迭代调优策略,在训练期间逐渐增加观察角度,其中模型将用于生成下一阶段训练数据。此外,我们在推理过程中引入时序打包模块以提升生成质量。我们的方法有效地利用了基础模型的先验知识而不损害其原始性能,实现了具有一致多视角一致性的 4D 视频生成。此外,我们的方法支持基于提示的内容编辑,显示出强大的灵活性,并在质量和灵活性方面显著优于最先进的方法。
引用
@article{arxiv.2506.04590,
title = {Follow-Your-Creation: Empowering 4D Creation through Video Inpainting},
author = {Yue Ma and Kunyu Feng and Xinhua Zhang and Hongyu Liu and David Junhao Zhang and Jinbo Xing and Yinhan Zhang and Ayden Yang and Zeyu Wang and Qifeng Chen},
journal= {arXiv preprint arXiv:2506.04590},
year = {2025}
}
备注
Project Page: https://follow-your-creation.github.io/