ActAnywhere:主体感知的视频背景生成
计算机视觉与模式识别
2024-01-22 v1
摘要
生成与前景主体运动相匹配的视频背景是电影行业和视觉特效领域的一个重要问题。该任务涉及合成与前景主体的运动和外观相一致,同时符合艺术家创作意图的背景。我们引入了ActAnywhere,一个自动化这一传统上需要繁琐手动工作的过程的生成模型。我们的模型利用大规模视频扩散模型的力量,并专门针对此任务进行了定制。ActAnywhere以前景主体分割序列作为输入,以及描述所需场景的图像作为条件,生成具有逼真前景-背景交互且遵循条件帧的连贯视频。我们在大规模人-场景交互视频数据集上训练了我们的模型。广泛的评估表明我们的模型具有优越的性能,显著优于基线。此外,我们展示了ActAnywhere能够泛化到各种分布外样本,包括非人类主体。请访问我们的项目网页:https://actanywhere.github.io。
引用
@article{arxiv.2401.10822,
title = {ActAnywhere: Subject-Aware Video Background Generation},
author = {Boxiao Pan and Zhan Xu and Chun-Hao Paul Huang and Krishna Kumar Singh and Yang Zhou and Leonidas J. Guibas and Jimei Yang},
journal= {arXiv preprint arXiv:2401.10822},
year = {2024}
}