中文

基于流均衡的构成式视频生成

计算机视觉与模式识别 2024-07-09 v1

摘要

大规模文本到视频扩散模型最近展示出将自然语言描述转化为惊艳且逼真视频的非凡能力。尽管已取得鼎舞结果,但仍面临显著挑战:这些模型难以充分把握多个概念和动作之间复杂的构成性相互作用。这一问题表现为某些词语在最终视频中占据主导地位,掩盖其他概念。为此,我们引入了 Vico—a 用于构成式视频生成的通用框架,显式确保所有概念都被妥善表示。其核心在于分析输入标记如何影响生成的视频,并调整模型以防止任何单个概念主导。具体而言,Vico 提取所有层的注意力权重构建空间-时间注意力图,然后估计从源文本标记到视频目标标记的注意力影响。虽然扩散模型中注意力流的直接计算通常不可行,但我们设计了基于子图流的高效近似方法,并采用快速矢量化实现,使得流计算可行且可微。通过更新带噪 latent 以平衡这些流,Vico 捕获复杂相互作用,从而生成文本描述精准的视频。我们将该方法应用于多种基于扩散的视频模型以实现构成式文本到视频和视频编辑。实证结果表明,该框架显著提升了生成视频的构成丰富性和准确性。访问我们的网站 https://adamdad.github.io/vico/。

关键词

引用

@article{arxiv.2407.06182,
  title  = {Compositional Video Generation as Flow Equalization},
  author = {Xingyi Yang and Xinchao Wang},
  journal= {arXiv preprint arXiv:2407.06182},
  year   = {2024}
}

备注

Project Page: https://adamdad.github.io/vico/. Source Code: https://github.com/Adamdad/vico