VideoMaker:基于视频扩散模型内在力量的零样本定制视频生成
计算机视觉与模式识别
2024-12-31 v2
摘要
零样本定制视频生成因其巨大的应用潜力而受到广泛关注。现有方法依赖额外模型提取和注入参考主题特征,假设视频扩散模型 (VDM) 本身不足以实现零样本定制视频生成。然而,这些方法常常因特征提取和注入技术不佳而难以维持主题外观的一致性。本文揭示了 VDM 本质上具备提取和注入主题特征的能力。我们 departing 从之前的启发式方法,引入一种新框架,利用 VDM 的内在力量实现高质量的零样本定制视频生成。具体而言,对于特征提取,我们直接将参考图像输入 VDM 并使用其内在特征提取过程,这不仅提供细粒度特征,还显著与 VDM 的预训练知识保持一致。对于特征注入,我们构思了一种创新的主题特征与生成内容之间的双向交互,通过 VDM 中的空间自注意力机制,确保 VDM 在保持生成视频多样性的同时获得更好的主题保真度。在针对定制化人物和物体视频生成的实验中验证了该框架的有效性。
引用
@article{arxiv.2412.19645,
title = {VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models},
author = {Tao Wu and Yong Zhang and Xiaodong Cun and Zhongang Qi and Junfu Pu and Huanzhang Dou and Guangcong Zheng and Ying Shan and Xi Li},
journal= {arXiv preprint arXiv:2412.19645},
year = {2024}
}
备注
Project Page: https://wutao-cs.github.io/VideoMaker/