中文

基于持续预测学习的动作定位

计算机视觉与模式识别 2020-03-30 v1

摘要

动作识别问题涉及在视频中随时间并在图像空间上定位动作。当前主流方法使用监督学习来解决该问题,并需要大量以感兴趣区域周围帧级边界框标注形式存在的标注训练数据。在本文中,我们提出一种基于持续学习的新方法,利用特征级预测进行自监督。它不需要任何帧级边界框形式的训练标注。该方法受视觉事件感知的认知模型启发,后者提出了一种基于预测的事件理解方法。我们使用堆叠的 LSTM 与 CNN 编码器耦合,并辅以新颖的注意力机制,来建模视频中的事件,并利用该模型预测未来帧的高层特征。预测误差被用于持续学习模型的参数。该自监督框架不像其他方法那样复杂,但在学习用于标注和定位的鲁棒视觉表示方面非常有效。需注意,该方法以流式方式输出,仅需对视频单次遍历,使其适用于实时处理。我们在三个数据集——UCF Sports、JHMDB 和 THUMOS'13 上演示了这一点,并表明所提方法优于弱监督和无监督基线,并与全监督基线取得有竞争力的性能。最后,我们展示所提框架可泛化到自我中心视频,并在无监督注视预测中取得最先进结果。

关键词

引用

@article{arxiv.2003.12185,
  title  = {Action Localization through Continual Predictive Learning},
  author = {Sathyanarayanan N. Aakur and Sudeep Sarkar},
  journal= {arXiv preprint arXiv:2003.12185},
  year   = {2020}
}

备注

18 pages, 4 figures and 3 tables