中文

视频中的弱监督动作选择学习

计算机视觉与模式识别 2021-05-07 v1

摘要

在视频中定位动作是计算机视觉中的一项核心任务。弱监督时序定位问题研究仅使用视频级标签是否足以很好地解决该任务,从而显著减少所需昂贵且易出错的标注量。一种常见方法是训练一个帧级分类器,选取类概率最高的帧进行视频级预测。随后帧级激活被用于定位。然而,缺乏帧级标注导致分类器将类偏置赋予每一帧。为此,我们提出动作选择学习(ASL)方法来捕捉动作的通用概念,即我们所称的“动作性”(actionness)。在 ASL 下,模型通过一个新颖的类别无关任务进行训练,以预测哪些帧将被分类器选中。实证上,我们表明 ASL 在两个流行基准 THUMOS-14 和 ActivityNet-1.2 上优于领先基线,相对提升分别为 10.3% 和 5.7%。我们进一步分析了 ASL 的性质并展示了动作性的重要性。本工作的完整代码见:https://github.com/layer6ai-labs/ASL。

关键词

引用

@article{arxiv.2105.02439,
  title  = {Weakly Supervised Action Selection Learning in Video},
  author = {Junwei Ma and Satya Krishna Gorti and Maksims Volkovs and Guangwei Yu},
  journal= {arXiv preprint arXiv:2105.02439},
  year   = {2021}
}

备注

CVPR 2021