中文

无递归或卷积的视频预测转换器

计算机视觉与模式识别 2026-01-15 v4

摘要

视频预测领域已涌现出以 ConvLSTM 为代表的 RNN 模型和以 SimVP 为代表的 CNN 模型。紧随 ViT 取得的显著成功之后,近期研究将 ViT 集成到 RNN 和 CNN 框架中,取得改进性能。尽管我们欣赏这些先前方法,但我们提出了一个根本性问题:是否存在一种更简洁且更有效的解决方案,可消除 RNN 的高计算成本,同时解决 CNN 的受限感受野和较差泛化问题?仅用简单纯转换器模型是否能实现更好的效果?本文提出了 PredFormer 框架,完全基于门控转换器实现。我们对视频预测语境下的 3D 注意力进行了全面分析。广泛实验表明,PredFormer 在四个标准基准测试中实现了最先进的性能。准确率和效率的显著提升凸显了 PredFormer 作为现实世界视频预测应用中强大基线的潜力。源代码和训练好的模型将发布于 https://github.com/yyyujintang/PredFormer。

关键词

引用

@article{arxiv.2410.04733,
  title  = {Video Prediction Transformers without Recurrence or Convolution},
  author = {Yujin Tang and Lu Qi and Xiangtai Li and Chao Ma and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2410.04733},
  year   = {2026}
}

备注

Accepted by Transactions on Machine Learning Research 2026; Project Page: https://yyyujintang.github.io/predformer-project/