中文

StyleCrafter:通过风格适配器增强风格化文本到视频生成

计算机视觉与模式识别 2024-09-13 v2 人工智能

摘要

文本到视频(T2V)模型在生成多样化视频方面已展现出显著能力。然而,由于(i)文本在表达特定风格时固有的笨拙性以及(ii)普遍退化的风格保真度,它们难以生成用户期望的风格化视频。为应对这些挑战,我们提出 StyleCrafter,一种通过风格控制适配器增强预训练 T2V 模型的通用方法,可通过提供参考图像实现任意风格的视频生成。考虑到风格化视频数据集的稀缺性,我们提议首先使用风格丰富的图像数据集训练风格控制适配器,随后通过量身定制的微调范式将习得的风格化能力迁移至视频生成。为促进内容与风格解耦,我们从文本提示中移除风格描述,并仅使用解耦学习策略从参考图像提取风格信息。此外,我们设计了一个尺度自适应融合模块以平衡基于文本的内容特征与基于图像的风格特征的影响,这有助于跨各种文本与风格组合的泛化。StyleCrafter 高效生成与文本内容对齐且近似参考图像风格的高质量风格化视频。实验表明我们的方法比现有竞争对手更灵活、更高效。

关键词

引用

@article{arxiv.2312.00330,
  title  = {StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter},
  author = {Gongye Liu and Menghan Xia and Yong Zhang and Haoxin Chen and Jinbo Xing and Yibo Wang and Xintao Wang and Yujiu Yang and Ying Shan},
  journal= {arXiv preprint arXiv:2312.00330},
  year   = {2024}
}

备注

SIGGRAPH Asia 2024 (Journal Track). Project: https://gongyeliu.github.io/StyleCrafter.github.io/ ; GitHub: https://github.com/GongyeLiu/StyleCrafter