中文

用于视频生成的时序一致 Transformer

计算机视觉与模式识别 2023-06-02 v2 人工智能 机器学习

摘要

为了生成准确的视频,算法必须理解世界中的空间与时间依赖关系。当前算法能在短时期内做出准确预测,但往往存在时序不一致的问题。当生成内容移出视野后又被重新看到时,模型会编造出不同的内容。尽管存在这一严重局限,目前尚无针对具有长时依赖的复杂数据上严格评估视频生成的既定基准。在本文中,我们通过渲染穿越程序化迷宫、Minecraft 世界和室内扫描的 3D 场景的行走过程,整理了 3 个具有长程依赖的挑战性视频数据集。我们对当前模型进行了全面评估,观察到它们在时序一致性上的局限。此外,我们引入了时序一致 Transformer(TECO),一种在大幅改善长期一致性的同时还减少了采样时间的生成模型。通过将输入序列压缩为更少的嵌入、应用时序 transformer 并使用空间 MaskGit 扩展回去,TECO 在许多指标上优于现有模型。视频见网站:https://wilson1yan.github.io/teco

关键词

引用

@article{arxiv.2210.02396,
  title  = {Temporally Consistent Transformers for Video Generation},
  author = {Wilson Yan and Danijar Hafner and Stephen James and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2210.02396},
  year   = {2023}
}

备注

Project website: https://wilson1yan.github.io/teco