中文

SSM 遇见视频扩散模型:基于结构化状态空间的高效长视频生成

计算机视觉与模式识别 2024-09-05 v4 人工智能

摘要

鉴于扩散模型在图像生成方面取得的显著成就,研究界对将这些模型扩展至视频生成表现出越来越浓厚的兴趣。近期用于视频生成的扩散模型主要利用注意力层来提取时间特征。然而,注意力层受限于其计算成本,该成本随序列长度呈二次增长。这一限制在利用扩散模型生成更长视频序列时带来了重大挑战。为了克服这一挑战,我们提出利用状态空间模型作为时间特征提取器。SSM(例如 Mamba)近期作为一种有前景的替代方案受到关注,因为其相对于序列长度具有线性时间的内存消耗。与先前研究表明在图像生成中使用双向 SSM 对理解空间特征很有效相一致,我们发现双向性对于捕获视频数据中的时间特征也是有益的,而不是依赖传统的单向 SSM。我们在多个长视频数据集(如 MineRL Navigate)上,针对各种模型规模进行了全面评估。对于长达256帧的序列,基于 SSM 的模型在达到相同 FVD 时所需的内存少于基于注意力的模型。此外,在可比的 GPU 内存使用量下,基于 SSM 的模型通常能提供更好的性能。我们的代码可在 https://github.com/shim0114/SSM-Meets-Video-Diffusion-Models 获取。

关键词

引用

@article{arxiv.2403.07711,
  title  = {SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces},
  author = {Yuta Oshima and Shohei Taniguchi and Masahiro Suzuki and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:2403.07711},
  year   = {2024}
}

备注

Accepted as a workshop paper at ICLR 2024