S-HR-VQVAE:用于视频预测的顺序分层残差学习向量量化变分自编码器
计算机视觉与模式识别
2024-11-20 v3 人工智能
机器学习
摘要
我们提出了一种新颖模型来解决视频预测任务,该模型结合了(i)一种新颖的分层残差学习向量量化变分自编码器(HR-VQVAE),以及(ii)一种新颖的自回归时空预测模型(AST-PM)。我们将此方法称为顺序分层残差学习向量量化变分自编码器(S-HR-VQVAE)。通过利用HR-VQVAE以简洁表示建模静态图像的内在能力,结合AST-PM处理时空信息的能力,S-HR-VQVAE能够更好地应对视频预测中的主要挑战。这些挑战包括学习时空信息、处理高维数据、克服模糊预测以及物理特性的隐式建模。在KTH Human Action、TrafficBJ、Human3.6M和Kitti四个具有挑战性任务上的大量实验结果表明,尽管模型规模小得多,我们的模型在定量和定性评估中均优于最先进的视频预测技术。最后,我们提出了一种新颖的训练方法来联合估计HR-VQVAE和AST-PM的参数,从而进一步提升S-HR-VQVAE。
引用
@article{arxiv.2307.06701,
title = {S-HR-VQVAE: Sequential Hierarchical Residual Learning Vector Quantized Variational Autoencoder for Video Prediction},
author = {Mohammad Adiban and Kalin Stefanov and Sabato Marco Siniscalchi and Giampiero Salvi},
journal= {arXiv preprint arXiv:2307.06701},
year = {2024}
}
备注
12 pages, 6 figures, 5 tables. Accepted for publication on IEEE Transactions on Multimedia on 2024-11-19