中文

MS-LSTM:在视频预测领域中探索时空多尺度表示

计算机视觉与模式识别 2024-02-19 v3

摘要

运动在空间和时域维度上的剧烈变化使得视频预测任务极具挑战性。现有的RNN模型通过加深或加宽模型来获得更高的性能。它们仅通过堆叠层来获取视频的多尺度特征,这种方式效率低下并带来难以承受的训练成本(如内存、FLOPs和训练时间)。与它们不同,本文从纯粹的多尺度视角提出了一种称为MS-LSTM的时空多尺度模型。在堆叠层的基础上,MS-LSTM引入了两种额外的有效多尺度设计,以充分捕获时空上下文信息。具体而言,我们采用具有镜像金字塔结构的LSTM来构建空间多尺度表示,并采用具有不同卷积核的LSTM来构建时间多尺度表示。我们从理论上分析了MS-LSTM及其组成部分的训练成本与性能。在四个视频数据集上与十二个基线模型的详细对比实验表明,MS-LSTM具有更好的性能但更低的训练成本。

关键词

引用

@article{arxiv.2304.07724,
  title  = {MS-LSTM: Exploring Spatiotemporal Multiscale Representations in Video Prediction Domain},
  author = {Zhifeng Ma and Hao Zhang and Jie Liu},
  journal= {arXiv preprint arXiv:2304.07724},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2206.03010