中文

面向长视频端到端生成建模的存储高效双向 Transformer

计算机视觉与模式识别 2023-06-01 v3

摘要

自回归 Transformer 在视频生成中已取得显著成功。然而,由于自注意力的二次复杂度,Transformer 无法直接学习视频中的长期依赖,并且因自回归过程固有地受限于缓慢的推理时间与误差传播。本文提出存储高效双向 Transformer(MeBT),用于视频中长期依赖的端到端学习与快速推理。基于双向 Transformer 的最新进展,我们的方法学习从部分观测的图像块并行解码整个视频的时空体。所提 Transformer 通过将可观测上下文令牌投影为固定数量的潜在令牌,并以其为条件通过交叉注意力解码被掩码令牌,在编码与解码中均达到线性时间复杂度。借助线性复杂度与双向建模,我们的方法在生成中等长度视频的质量与速度上均较自回归 Transformer 有显著提升。视频与代码见 https://sites.google.com/view/mebt-cvpr2023 。

关键词

引用

@article{arxiv.2303.11251,
  title  = {Towards End-to-End Generative Modeling of Long Videos with Memory-Efficient Bidirectional Transformers},
  author = {Jaehoon Yoo and Semin Kim and Doyup Lee and Chiheon Kim and Seunghoon Hong},
  journal= {arXiv preprint arXiv:2303.11251},
  year   = {2023}
}