GVDIFF:基于扩散模型的 grounded 文本到视频生成
计算机视觉与模式识别
2024-07-08 v2
摘要
在文本到视频(T2V)生成领域,人们已广泛关注其发展,但统一文本到视频生成中离散化与连续化 grounding 条件的工作仍鲜有探索。本文提出一种名为 GVDIFF 的 grounded 文本到视频生成框架。首先,我们通过基于不确定性表示的方式将 grounding 条件注入自注意力机制中,以显式引导网络关注重点。其次,我们引入空间时间 grounding 层,将 grounding 条件与目标对象关联,使模型在空间时间域上具备 grounded 生成能力。此外,我们的动态门控网络会自适应地跳过冗余的 grounding 流程,以选择性地提取 grounding 信息与语义,同时提升效率。我们对 GVDIFF 的 grounded 生成能力进行了广泛评估,并展示了其在长范围视频生成、顺序提示和对象特定编辑等应用场景中的多样性。
引用
@article{arxiv.2407.01921,
title = {GVDIFF: Grounded Text-to-Video Generation with Diffusion Models},
author = {Huanzhang Dou and Ruixiang Li and Wei Su and Xi Li},
journal= {arXiv preprint arXiv:2407.01921},
year = {2024}
}