利用弱监督下自注意力可迁移表征对未裁剪视频进行动作识别
计算机视觉与模式识别
2019-02-21 v1
摘要
视频中的动作识别在过去十年中吸引了大量关注。为了学习鲁棒模型,以往方法通常假设视频被裁剪为短序列,并需要每个视频帧/序列的 ground-truth 标注,这相当昂贵且耗时。在本文中,仅给定视频级标注,我们提出一种新颖的弱监督框架,用于同时定位未裁剪视频中的动作帧并识别动作。我们提出的框架由两个主要组件构成。首先,对于动作帧定位,我们利用自注意力机制对每帧加权,从而有效消除背景帧的影响。其次,考虑到公开可用的裁剪视频且它们包含可利用的有用信息,我们提出一个额外模块,将裁剪视频中的知识迁移以提升未裁剪视频中的分类性能。在两个基准数据集(即 THUMOS14 和 ActivityNet1.3)上进行了大量实验,实验结果清楚地证实了我们的方法的有效性。
引用
@article{arxiv.1902.07370,
title = {Learning Transferable Self-attentive Representations for Action Recognition in Untrimmed Videos with Weak Supervision},
author = {Xiao-Yu Zhang and Haichao Shi and Changsheng Li and Kai Zheng and Xiaobin Zhu and Lixin Duan},
journal= {arXiv preprint arXiv:1902.07370},
year = {2019}
}