MOFA-Video:基于冻结图像到视频扩散模型中的可控运动场适配器的可控图像动画
计算机视觉与模式识别
2024-07-12 v3 人工智能
摘要
我们提出了 MOFA-Video,这是一种先进的可控图像动画方法,可通过各种额外的可控信号(如人类 landmarks 参考、手动轨迹以及另一个提供的视频)或其组合,从给定图像生成视频。这与以前的方法不同,后者只能在特定运动领域内工作,或在扩散先验下显示出弱控制能力。为实现目标,我们设计了若干领域感知的运动场适配器(即 MOFA-Adapters),以控制视频生成管道中的生成运动。对于 MOFA-Adapters,我们考虑视频的时间运动一致性,首先从给定的稀疏控制条件生成密集运动流,然后,将给定图像的多尺度特征包装为引导特征,以实现稳定的视频扩散生成。我们粗略地为手动轨迹和人类 landmarks 各自训练两个运动适配器,因为它们都包含关于控制的稀疏信息。训练后,MOFA-Adapters 在不同领域也可以协同工作,以实现更可控的视频生成。项目页面:https://myniuuu.github.io/MOFA_Video/
引用
@article{arxiv.2405.20222,
title = {MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model},
author = {Muyao Niu and Xiaodong Cun and Xintao Wang and Yong Zhang and Ying Shan and Yinqiang Zheng},
journal= {arXiv preprint arXiv:2405.20222},
year = {2024}
}
备注
ECCV 2024 ; Project Page: https://myniuuu.github.io/MOFA_Video/ ; Codes: https://github.com/MyNiuuu/MOFA-Video