中文

标注高效的未修剪视频动作识别

计算机视觉与模式识别 2021-11-02 v3

摘要

深度学习在视频动作识别中已取得巨大成功,但训练数据的收集与标注仍相当费力,主要体现在两方面:(1) 所需标注数据量大;(2) 时序标注每个动作的位置耗时。诸如少样本学习或未修剪视频识别等工作已被提出以分别处理其中一方面。然而,极少有现有工作能同时处理两个问题。本文中,我们面向一个新问题——标注高效视频识别,以降低对大量样本及动作位置标注的需求。该问题具挑战性源于两方面:(1) 未修剪视频仅有弱监督;(2) 与当前关注动作无关的视频段(背景,BG)可能包含新类别中的关注动作(前景,FG),这是一种广泛存在但少有在少样本未修剪视频识别中被研究的现象。为实现此目标,通过分析 BG 的性质,我们将 BG 分为信息性背景(IBG)与非信息性背景(NBG),并提出 (1) 一种基于开集检测的方法以找出 NBG 与 FG,(2) 一种对比学习方法以自监督方式学习 IBG 并区分 NBG,(3) 一种自加权机制以更好区分 IBG 与 FG。在 ActivityNet v1.2 与 ActivityNet v1.3 上的大量实验验证了所提方法的合理性与有效性。

关键词

引用

@article{arxiv.2011.14478,
  title  = {Annotation-Efficient Untrimmed Video Action Recognition},
  author = {Yixiong Zou and Shanghang Zhang and Guangyao Chen and Yonghong Tian and Kurt Keutzer and José M. F. Moura},
  journal= {arXiv preprint arXiv:2011.14478},
  year   = {2021}
}