中文

V-Express: 用于人像视频生成渐进训练的条件丢弃

计算机视觉与模式识别 2024-06-05 v1 人工智能

摘要

在人像视频生成领域,使用单张图像生成人像视频已变得越来越普遍。常见的方法是利用生成模型增强适配器以实现受控生成。然而,控制信号(例如文本、音频、参考图像、姿态、深度图等)的强度可能不同。其中,较弱的条件由于受到较强条件的干扰而难以有效发挥作用,这给平衡这些条件带来了挑战。在我们的人像视频生成工作中,我们发现音频信号特别弱,常常被更强的信号(如面部姿态和参考图像)所掩盖。然而,直接使用弱信号进行训练往往导致收敛困难。为了解决这个问题,我们提出了V-Express,一种通过渐进训练和条件丢弃操作来平衡不同控制信号的简单方法。我们的方法逐步使弱条件能够有效控制,从而实现同时考虑面部姿态、参考图像和音频的生成能力。实验结果表明,我们的方法能够有效生成由音频控制的人像视频。此外,为同时有效使用不同强度的条件提供了一种潜在解决方案。

关键词

引用

@article{arxiv.2406.02511,
  title  = {V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation},
  author = {Cong Wang and Kuan Tian and Jun Zhang and Yonghang Guan and Feng Luo and Fei Shen and Zhiwei Jiang and Qing Gu and Xiao Han and Wei Yang},
  journal= {arXiv preprint arXiv:2406.02511},
  year   = {2024}
}