DreamVideo-2:基于单图和边界框序列的零样本主体驱动视频定制
计算机视觉与模式识别
2024-10-18 v1
摘要
近期定制化视频生成技术进步使用户能够创建针对特定主体和运动轨迹的视频,但现有方法常需复杂的测试时微调,且难以在主体学习与运动控制之间取得平衡,限制了实际应用。本文提出 DreamVideo-2,一个零样本视频定制框架,无需测试时微调,即可生成特定主体和运动轨迹的视频。具体而言,我们引入参考注意力,利用模型内置的主体学习能力,并设计掩码引导的运动模块,通过充分利用来自边界框派生的盒子掩码中强大的运动信号,实现精确运动控制。尽管这两部分组件各自发挥作用,我们经验性地发现运动控制倾向于主导于主体学习。为此,我们提出两种关键设计:1)掩码化参考注意力,将混合 latent 掩码建模方案整合到参考注意力中,以增强所需位置的主体表征;2)重新加权扩散损失,对边界框内外区域的贡献进行加权,确保主体学习与运动控制之间的平衡。大量实验结果表明,DreamVideo-2 在主体定制和运动控制方面均优于最先进的方法。该数据集、代码和模型将公开提供。
引用
@article{arxiv.2410.13830,
title = {DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control},
author = {Yujie Wei and Shiwei Zhang and Hangjie Yuan and Xiang Wang and Haonan Qiu and Rui Zhao and Yutong Feng and Feng Liu and Zhizhong Huang and Jiaxin Ye and Yingya Zhang and Hongming Shan},
journal= {arXiv preprint arXiv:2410.13830},
year = {2024}
}
备注
Project page: https://dreamvideo2.github.io/