中文

VideoLightFormer:基于 Transformer 的轻量级动作识别

计算机视觉与模式识别 2021-11-19 v2 机器学习

摘要

高效的视频动作识别仍是一个具有挑战性的问题。一个又一个大型模型在 Kinetics 数据集上取代先前的 state-of-the-art,但往往缺乏真实的效率评估。本工作中,我们填补这一空白并研究使用 transformers 进行高效动作识别。我们提出了一种新颖的轻量级动作识别架构 VideoLightFormer。以分解方式,我们仔细地将 2D 卷积 Temporal Segment Network 用 transformers 扩展,同时在整个模型中保持视频的时空结构。现有方法常诉诸两种极端之一,要么对视频特征应用巨大的 transformers,要么对高度池化的视频特征应用极小的 transformers。我们的方法与之不同,保持 transformer 模型小巧,但利用完整的时空特征结构。我们在耗时要求的 EPIC-KITCHENS-100 和 Something-Something-V2(SSV2)数据集的高效设定下评估 VideoLightFormer,发现除 SSV2 上的 Temporal Shift Module 外,它比现有 state-of-the-art 模型取得了更好的效率与精度平衡。

关键词

引用

@article{arxiv.2107.00451,
  title  = {VideoLightFormer: Lightweight Action Recognition using Transformers},
  author = {Raivo Koot and Haiping Lu},
  journal= {arXiv preprint arXiv:2107.00451},
  year   = {2021}
}

备注

Rejected at NeurIPS 2021. Paper withdrawn from arxiv