用于遮挡视频预测的快速傅里叶 Inception 网络
计算机视觉与模式识别
2023-09-22 v1
摘要
视频预测是一项像素级任务,通过利用历史帧来生成未来帧。视频中常常存在连续复杂运动,例如物体重叠与场景遮挡,这给该任务带来了巨大挑战。以往的工作要么未能很好地捕捉长期时间动态,要么未处理遮挡掩码。为解决这些问题,我们开发了用于视频预测的全卷积快速傅里叶 Inception 网络,称为 \textit{FFINet},其包含两个主要组件,即遮挡修复器与时空转换器。前者采用快速傅里叶卷积来扩大感受野,从而由修复器填充具有复杂几何结构的缺失区域(遮挡)。后者采用堆叠的傅里叶变换 Inception 模块,通过分组卷积学习时间演化,并通过通道级傅里叶卷积学习空间运动,从而同时捕捉局部与全局时空特征。这有助于生成更真实且高质量的未来帧。为优化模型,在目标函数中施加了恢复损失,即最小化真实帧与恢复帧之间的均方误差。在包括 Moving MNIST、TaxiBJ、Human3.6M、Caltech Pedestrian 和 KTH 在内的五个基准上的定量与定性实验结果均证明了所提方法的优越性。我们的代码已在 GitHub 上公开。
引用
@article{arxiv.2306.10346,
title = {Fast Fourier Inception Networks for Occluded Video Prediction},
author = {Ping Li and Chenhan Zhang and Xianghua Xu},
journal= {arXiv preprint arXiv:2306.10346},
year = {2023}
}