中文

基于高效 Transformer 的视频预测

计算机视觉与模式识别 2022-12-13 v1

摘要

视频预测是一项具有广泛应用前景、极具挑战性的计算机视觉任务。本文提出了一系列基于 Transformer 的视频预测新模型。首先,提出了一种高效的局部时空分离注意力机制,以降低标准 Transformer 的复杂度。随后,基于这一新型高效 Transformer,分别构建了全自回归模型、部分自回归模型和非自回归模型。部分自回归模型与全自回归模型性能相近,但推理速度更快。非自回归模型不仅推理速度更快,还缓解了自回归模型 counterpart 的质量退化问题,但其需要额外的参数和损失函数用于学习。在相同的注意力机制下,我们对所提出的三种视频预测变体进行了全面对比研究。实验表明,所提出的视频预测模型可与更为复杂的基于卷积-LSTM 的 SOTA 模型相媲美。源代码见 https://github.com/XiYe20/VPTR。

关键词

引用

@article{arxiv.2212.06026,
  title  = {Video Prediction by Efficient Transformers},
  author = {Xi Ye and Guillaume-Alexandre Bilodeau},
  journal= {arXiv preprint arXiv:2212.06026},
  year   = {2022}
}

备注

Accepted by Image and Vision Computing. arXiv admin note: text overlap with arXiv:2203.15836