中文

Context-LSTM:一种用于 UCF101 视频检测的鲁棒分类器

计算机视觉与模式识别 2022-03-15 v1 人工智能 机器学习

摘要

视频检测与人动作识别可能计算开销大,且需长时间训练模型。本文旨在减少视频训练时间与 GPU 显存占用,并取得具竞争力的检测精度。其他研究工作如 Two-stream、C3D、TSN 已在 UCF101 上展现优异性能。此处,我们仅采用 LSTM 结构进行视频检测。我们以简洁结构在 UCF101 完整验证集上取得具竞争力的 top-1 精度。该 LSTM 结构命名为 Context-LSTM,因其可处理深度时序特征。Context-LSTM 可模拟人类识别系统。我们在 PyTorch 中级联 LSTM 块并连接单元状态流与隐藏输出流。在块的连接处,我们使用 ReLU、Batch Normalization 与 MaxPooling 函数。Context-LSTM 能减少训练时间与 GPU 显存占用,同时在 UCF101 完整验证集上保持最先进的 top-1 精度,在视频动作检测上展现出鲁棒性能。

关键词

引用

@article{arxiv.2203.06610,
  title  = {Context-LSTM: a robust classifier for video detection on UCF101},
  author = {Dengshan Li and Rujing Wang},
  journal= {arXiv preprint arXiv:2203.06610},
  year   = {2022}
}

备注

15 pages,6 figures