CustomVideo:利用多主体定制文本到视频生成
计算机视觉与模式识别
2025-10-29 v3
摘要
定制文本到视频生成旨在根据文本提示和主体参考生成高质量视频。当前的个性化文本到视频生成方法在处理多主体方面存在困难,这是一个更具挑战性且实际的场景。在本工作中,我们的目标是促进多主体引导的文本到视频定制。我们提出了 CustomVideo,这是一个新颖的框架,可以在多个主体的引导下生成保持身份的视频。具体而言,首先,我们通过将多个主体组合在单张图像中来鼓励它们的同时出现。其次,在基础文本到视频扩散模型之上,我们设计了一种简单而有效的注意力控制策略,以在扩散模型的潜在空间中解耦不同的主体。此外,为了帮助模型聚焦于对象的特定区域,我们从给定的参考图像中分割对象,并提供相应的对象掩码用于注意力学习。此外,我们收集了一个多主体文本到视频生成数据集作为综合基准。大量的定性、定量和用户研究结果证明了我们的方法相较于先前最先进方法的优越性。项目页面为 https://kyfafyd.wang/projects/customvideo。
引用
@article{arxiv.2401.09962,
title = {CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects},
author = {Zhao Wang and Aoxue Li and Lingting Zhu and Yong Guo and Qi Dou and Zhenguo Li},
journal= {arXiv preprint arXiv:2401.09962},
year = {2025}
}
备注
IEEE TMM 2025