中文

GVDIFF:基于扩散模型的 grounded 文本到视频生成

计算机视觉与模式识别 2024-07-08 v2

摘要

在文本到视频(T2V)生成领域,人们已广泛关注其发展,但统一文本到视频生成中离散化与连续化 grounding 条件的工作仍鲜有探索。本文提出一种名为 GVDIFF 的 grounded 文本到视频生成框架。首先,我们通过基于不确定性表示的方式将 grounding 条件注入自注意力机制中,以显式引导网络关注重点。其次,我们引入空间时间 grounding 层,将 grounding 条件与目标对象关联,使模型在空间时间域上具备 grounded 生成能力。此外,我们的动态门控网络会自适应地跳过冗余的 grounding 流程,以选择性地提取 grounding 信息与语义,同时提升效率。我们对 GVDIFF 的 grounded 生成能力进行了广泛评估,并展示了其在长范围视频生成、顺序提示和对象特定编辑等应用场景中的多样性。

关键词

引用

@article{arxiv.2407.01921,
  title  = {GVDIFF: Grounded Text-to-Video Generation with Diffusion Models},
  author = {Huanzhang Dou and Ruixiang Li and Wei Su and Xi Li},
  journal= {arXiv preprint arXiv:2407.01921},
  year   = {2024}
}