中文

基于块的高效以对象为中心视频生成 Transformer

计算机视觉与模式识别 2022-06-22 v2 机器学习

摘要

在这项工作中,我们提出基于块以对象为中心视频 Transformer (POVT),一种新颖的基于区域的视频生成架构,它利用以对象为中心的信息来高效建模视频中的时间动态。我们建立在先前通过压缩视频离散潜空间上的自回归 transformer 进行视频预测的工作之上,并增加了一个通过边界框建模以对象为中心信息的改进。由于以对象为中心的表示具有更好的可压缩性,我们可以通过让模型仅访问更长时域时间信息的对象信息来提高训练效率。在各种困难的以对象为中心数据集上评估时,我们的方法取得了优于或等同于其他视频生成模型的性能,同时保持更高的计算效率与可扩展性。此外,我们展示了我们的方法能够通过边界框操控实现以对象为中心的可控性,这可能有助于视频编辑或视觉规划等下游任务。样本见 https://sites.google.com/view/povt-public

关键词

引用

@article{arxiv.2206.04003,
  title  = {Patch-based Object-centric Transformers for Efficient Video Generation},
  author = {Wilson Yan and Ryo Okumura and Stephen James and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2206.04003},
  year   = {2022}
}

备注

Project Website: https://sites.google.com/view/povt-public