中文

一种用于视频中动作预测的端到端多尺度网络

计算机视觉与模式识别 2023-01-04 v1

摘要

本文中,我们开发了一种高效的多尺度网络,以端到端方式在部分视频中预测动作类别。与大多数采用离线特征生成的现有方法不同,我们的方法直接以帧为输入,并在两种不同时间尺度上进一步建模运动演化。因此,我们解决了两阶段建模的复杂性问题以及单尺度时空信息不足的问题。我们提出的端到端多尺度网络(E2EMSNet)由称为片段尺度与观测全局尺度的两个尺度组成。片段尺度利用连续帧间的时间差分,通过提供 2D 卷积获取更精细的运动模式。对于观测全局尺度,引入长短期记忆(LSTM)以捕获观测帧的运动特征。我们的模型以较小计算成本提供了简洁高效的建模框架。我们的 E2EMSNet 在三个具挑战性数据集 BIT、HMDB51 与 UCF101 上进行了评估。大量实验证明了我们方法在视频动作预测中的有效性。

关键词

引用

@article{arxiv.2301.01216,
  title  = {An end-to-end multi-scale network for action prediction in videos},
  author = {Xiaofa Liu and Jianqin Yin and Yuan Sun and Zhicheng Zhang and Jin Tang},
  journal= {arXiv preprint arXiv:2301.01216},
  year   = {2023}
}

备注

12 pages, 6 figures