通过演示创建视频
计算机视觉与模式识别
2024-12-13 v1
摘要
我们探索了一种新的视频创建体验,即通过演示创建视频。给定演示视频和来自不同场景的背景图像,我们生成一个在背景图像自然延续且执行演示中动作概念的物理上合理的视频。为实现此功能,我们提出了一种称为 -Diffusion 的自监督训练方法,通过条件未来帧预测从无标签视频中学习。与大多数基于显式信号的现有视频生成控制方法不同,我们采用隐式潜在控制形式,以实现通用视频所需的最大灵活性和表达性。通过在视频基础模型上构建具有外观瓶颈设计的架构,我们从演示视频中提取动作潜在变量,以最小的外观泄漏对生成过程进行条件控制。经验上,-Diffusion 在人类偏好和大规模机器评估方面均优于相关基线方法,并显示出面向交互式世界模拟的潜力。采样的视频生成结果可在 https://delta-diffusion.github.io/ 查看。
引用
@article{arxiv.2412.09551,
title = {Video Creation by Demonstration},
author = {Yihong Sun and Hao Zhou and Liangzhe Yuan and Jennifer J. Sun and Yandong Li and Xuhui Jia and Hartwig Adam and Bharath Hariharan and Long Zhao and Ting Liu},
journal= {arXiv preprint arXiv:2412.09551},
year = {2024}
}
备注
Project page at https://delta-diffusion.github.io/