中文

VideoDreamer:基于语言-视频基础模型上解耦混合微调的定制化多主体文本到视频生成

计算机视觉与模式识别 2025-04-15 v2

摘要

定制化文本到视频生成旨在生成带有用户给定主体的文本引导视频,已获得越来越多的关注。然而,现有工作主要局限于面向单主体的文本到视频生成,更具挑战性的定制化多主体生成问题尚待探索。本文填补该空白并提出一种新颖的 VideoDreamer 框架,可生成时间一致、文本引导且忠实保留所给多个主体视觉特征的视频。具体而言,VideoDreamer 采用带时间模块的预训练 Stable Diffusion 作为基础视频生成器,借助文本到图像模型的能力生成多样化内容。该视频生成器进一步针对多主体进行定制,利用所提的解耦混合微调(Disen-Mix Finetuning)与人在回路重微调(Human-in-the-Loop Re-finetuning)策略,以解决多主体生成的属性绑定问题。此外,我们提出解耦运动定制策略以微调时间模块,从而生成兼具定制主体与运动的视频。为评估定制化多主体文本到视频生成的性能,我们引入了 MultiStudioBench 基准。大量实验证明了 VideoDreamer 在生成带有新内容(如新事件与背景)、契合定制化多个主体的视频方面的卓越能力。

关键词

引用

@article{arxiv.2311.00990,
  title  = {VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models},
  author = {Hong Chen and Xin Wang and Guanning Zeng and Yipeng Zhang and Yuwei Zhou and Feilin Han and Yaofei Wu and Wenwu Zhu},
  journal= {arXiv preprint arXiv:2311.00990},
  year   = {2025}
}