中文

SRVP:基于注意力时空相关性融合的强回忆视频预测模型

计算机视觉与模式识别 2025-04-17 v2

摘要

视频预测(Video Prediction, VP)通过利用过去帧的空间表示和时间上下文来生成未来帧。传统的基于循环神经网络(RNN)的模型通过增强记忆单元结构来捕捉长时间跨度内的时空状态,但会逐渐丢失目标外观细节。为了解决这个问题,我们提出了强回忆视频预测(SRVP)模型,该模型集成了标准注意力(SA)和增强特征注意力(RFA)模块。这两个模块均采用缩放点积注意力来提取时间上下文和空间相关性,随后将其融合以增强时空表示。在三个基准数据集上的实验表明,SRVP 缓解了基于 RNN 的模型中的图像质量退化问题,同时实现了与无 RNN 架构相当的预测性能。

关键词

引用

@article{arxiv.2504.08012,
  title  = {SRVP: Strong Recollection Video Prediction Model Using Attention-Based Spatiotemporal Correlation Fusion},
  author = {Yuseon Kim and Kyongseok Park},
  journal= {arXiv preprint arXiv:2504.08012},
  year   = {2025}
}

备注

This paper has been accepted to CVPR 2025 Precognition Workshop