中文

基于新动作识别基准的时空表征学习大规模研究

计算机视觉与模式识别 2023-08-22 v2

摘要

构建基准(数据集套件)的目标是为公平评估提供统一协议,从而促进特定领域的演进。然而我们指出,现有动作识别协议因若干局限可能导致片面评估。为全面探查时空表征学习的有效性,我们引入 BEAR,一个视频动作识别的新基准(BEnchmark on video Action Recognition)。BEAR 是分为 5 类(异常、手势、日常、体育与教学)的 18 个视频数据集的集合,涵盖多样的真实世界应用。借助 BEAR,我们彻底评估了 6 种由监督与自监督学习预训练的常用时空模型。我们还通过标准微调、少样本微调与无监督域适应报告了迁移性能。我们的观察表明,当前最优方法无法可靠保证在接近真实世界应用的数据集上高性能,并希望 BEAR 能作为公平且具挑战性的评估基准,为构建下一代时空学习器提供见解。我们的数据集、代码与模型发布于:https://github.com/AndongDeng/BEAR

关键词

引用

@article{arxiv.2303.13505,
  title  = {A Large-scale Study of Spatiotemporal Representation Learning with a New Benchmark on Action Recognition},
  author = {Andong Deng and Taojiannan Yang and Chen Chen},
  journal= {arXiv preprint arXiv:2303.13505},
  year   = {2023}
}

备注

ICCV 2023