SRVP:基于注意力时空相关性融合的强回忆视频预测模型
计算机视觉与模式识别
2025-04-17 v2
摘要
视频预测(Video Prediction, VP)通过利用过去帧的空间表示和时间上下文来生成未来帧。传统的基于循环神经网络(RNN)的模型通过增强记忆单元结构来捕捉长时间跨度内的时空状态,但会逐渐丢失目标外观细节。为了解决这个问题,我们提出了强回忆视频预测(SRVP)模型,该模型集成了标准注意力(SA)和增强特征注意力(RFA)模块。这两个模块均采用缩放点积注意力来提取时间上下文和空间相关性,随后将其融合以增强时空表示。在三个基准数据集上的实验表明,SRVP 缓解了基于 RNN 的模型中的图像质量退化问题,同时实现了与无 RNN 架构相当的预测性能。
引用
@article{arxiv.2504.08012,
title = {SRVP: Strong Recollection Video Prediction Model Using Attention-Based Spatiotemporal Correlation Fusion},
author = {Yuseon Kim and Kyongseok Park},
journal= {arXiv preprint arXiv:2504.08012},
year = {2025}
}
备注
This paper has been accepted to CVPR 2025 Precognition Workshop