VMC:通过时间注意力适配实现文本到视频扩散模型的视频运动定制
计算机视觉与模式识别
2023-12-05 v1 人工智能
机器学习
摘要
文本到视频扩散模型显著推进了视频生成。然而,定制这些模型以生成具有定制运动的视频带来了重大挑战。具体来说,它们在(a)准确再现目标视频的运动,以及(b)创建多样化的视觉变化方面遇到障碍。例如,将静态图像定制方法直接扩展到视频通常会导致外观和运动数据的复杂纠缠。为解决此问题,我们提出了视频运动定制(VMC)框架,这是一种新颖的一次性调优方法,旨在适应视频扩散模型中的时间注意力层。我们的方法引入了一种新颖的运动蒸馏目标,使用连续帧之间的残差向量作为运动参考。然后,扩散过程保留低频运动轨迹,同时减轻图像空间中高频运动无关噪声。我们针对各种真实世界运动和上下文,将我们的方法与最先进的视频生成模型进行了验证。我们的代码、数据和项目演示可在https://video-motion-customization.github.io找到。
引用
@article{arxiv.2312.00845,
title = {VMC: Video Motion Customization using Temporal Attention Adaption for Text-to-Video Diffusion Models},
author = {Hyeonho Jeong and Geon Yeong Park and Jong Chul Ye},
journal= {arXiv preprint arXiv:2312.00845},
year = {2023}
}
备注
Project page: https://video-motion-customization.github.io