中文

从动作时刻中学习定位动作

计算机视觉与模式识别 2020-09-01 v1

摘要

凭借对动作时刻(即每个包含一段动作实例的修剪后视频片段)的认知,人类可常规地在未修剪视频中 temporally 定位动作。然而,尽管标注代价高昂且无法适用于新类别,多数实用方法仍要求所有训练视频均标有时间标注(动作类别与时间边界)并以全监督方式开发模型。本文中,我们引入一种新型迁移学习设计,以学习大类别集的动作定位,但仅使用来自关注类别的动作时刻以及来自小规模动作类的未修剪视频的时间标注。具体地,我们提出动作预示网络(AherNet),将此类设计集成至单阶段动作定位框架。技术上,独特设计了一个权重转移函数,以构建动作时刻或前景视频片段的分类与合成上下文时刻或未修剪视频中动作定位之间的变换。各时刻的上下文通过对抗机制学习,以区分所生成特征与未修剪视频中背景特征。我们在ActivityNet v1.3的划分间以及从THUMOS14到ActivityNet v1.3的学习上进行了广泛实验。我们的AherNet即使与多数全监督动作定位方法相比也展现出优越性。更显著地,我们利用Kinetics-600中的动作时刻与ActivityNet v1.3中200类的时序标注训练AherNet以定位600类动作。源代码与数据见 \url{https://github.com/FuchenUSTC/AherNet}。

关键词

引用

@article{arxiv.2008.13705,
  title  = {Learning to Localize Actions from Moments},
  author = {Fuchen Long and Ting Yao and Zhaofan Qiu and Xinmei Tian and Jiebo Luo and Tao Mei},
  journal= {arXiv preprint arXiv:2008.13705},
  year   = {2020}
}

备注

ECCV 2020 Oral; The source code and data are available at: https://github.com/FuchenUSTC/AherNet