中文

UniVG:迈向统一模态的视频生成

计算机视觉与模式识别 2024-01-18 v1

摘要

基于扩散模型的视频生成在学术界和工业界均受到了广泛关注并取得了显著成功。然而,当前的努力主要集中在单目标或单任务视频生成上,例如由文本驱动、由图像驱动或由文本与图像组合驱动的视频生成。这无法完全满足现实应用场景的需求,因为用户可能以灵活的方式输入图像和文本条件,无论是单独输入还是组合输入。为解决这一问题,我们提出了一种统一模态视频生成(Unified-modal Video Generation, UniVG)系统,能够处理跨文本和图像模态的多种视频生成任务。为此,我们从生成自由度的角度重新审视了系统中的各种视频生成任务,并将其分类为高自由度视频生成和低自由度视频生成。对于高自由度视频生成,我们采用多条件交叉注意力(Multi-condition Cross Attention)来生成与输入图像或文本语义对齐的视频。对于低自由度视频生成,我们引入偏置高斯噪声(Biased Gaussian Noise)替代纯随机高斯噪声,这有助于更好地保留输入条件的内容。我们的方法在公开学术基准 MSR-VTT 上实现了最低的 Fréchet Video Distance (FVD),在人工评估中超越了当前的开源方法,并与当前的闭源方法 Gen2 相当。更多样本请访问 https://univg-baidu.github.io。

关键词

引用

@article{arxiv.2401.09084,
  title  = {UniVG: Towards UNIfied-modal Video Generation},
  author = {Ludan Ruan and Lei Tian and Chuanwei Huang and Xu Zhang and Xinyan Xiao},
  journal= {arXiv preprint arXiv:2401.09084},
  year   = {2024}
}