中文

PEEKABOO:基于掩码扩散的交互式视频生成

计算机视觉与模式识别 2024-04-23 v2 机器学习

摘要

像 Sora 这样的现代视频生成模型在生成高质量视频方面取得了显著成功。然而,一个重大局限是它们无法为用户提供交互式控制,而这一功能有望开启前所未有的应用与创造力。在这项工作中,我们引入了首个为基于扩散的视频生成模型赋予时空控制能力的解决方案。我们提出了 Peekaboo,一种新颖的掩码注意力模块,它可与当前的视频生成模型无缝集成,在无需额外训练或推理开销的情况下提供控制能力。为促进未来研究,我们还引入了一个全面的交互式视频生成基准测试。该基准测试为社区提供了一个标准化框架,以评估新兴交互式视频生成模型的有效性。我们广泛的定性和定量评估表明,Peekaboo 在 mIoU 上比基线模型最高提升了 3.8 倍,同时保持了相同的延迟。代码和基准测试可在网页上获取。

关键词

引用

@article{arxiv.2312.07509,
  title  = {PEEKABOO: Interactive Video Generation via Masked-Diffusion},
  author = {Yash Jain and Anshul Nasery and Vibhav Vineet and Harkirat Behl},
  journal= {arXiv preprint arXiv:2312.07509},
  year   = {2024}
}

备注

Project webpage - https://jinga-lala.github.io/projects/Peekaboo/