中文

STIP:一种用于高分辨率视频预测的时空信息保持与感知增强模型

计算机视觉与模式识别 2022-06-10 v1 人工智能

摘要

尽管基于循环神经网络(RNN)的视频预测方法已取得显著成果,但由于信息丢失问题以及基于不敏感感知的均方误差(MSE)损失函数,它们在高分辨率数据集上的性能仍远不能令人满意。本文中,我们提出一种时空信息保持与感知增强模型(STIP)来解决上述两个问题。为解决信息丢失问题,所提模型旨在特征提取与状态转移两个阶段分别保持视频的时空信息。首先,基于 X-Net 结构设计了一个多粒度时空自编码器(MGST-AE)。所提 MGST-AE 可帮助解码器在时域和空域均从编码器回忆多粒度信息。以此方式,在高分辨率视频的特征提取过程中可保持更多时空信息。其次,基于标准门控循环单元(GRU)结构设计了一个时空门控循环单元(STGRU),其可在状态转移过程中高效保持时空信息。与流行的基于长短期记忆(LSTM)的预测记忆相比,所提 STGRU 能以低得多的计算负载取得更令人满意的性能。此外,为改进传统 MSE 损失函数,进一步基于生成对抗网络(GANs)设计了一种习得感知损失(LP-loss),其有助于在客观质量与感知质量间获得令人满意的权衡。实验结果表明,与多种最先进方法相比,所提 STIP 能预测出具有更令人满意视觉质量的视频。源代码已发布于 \url{https://github.com/ZhengChang467/STIPHR}。

关键词

引用

@article{arxiv.2206.04381,
  title  = {STIP: A SpatioTemporal Information-Preserving and Perception-Augmented Model for High-Resolution Video Prediction},
  author = {Zheng Chang and Xinfeng Zhang and Shanshe Wang and Siwei Ma and Wen Gao},
  journal= {arXiv preprint arXiv:2206.04381},
  year   = {2022}
}

备注

This journal paper is extended from our previous work accepted in CVPR2022 and has been submitted to IEEE Transactions on Multimedia