中文

ActionSpotter:用于视频中时序动作定位的深度强化学习框架

机器学习 2020-11-11 v2 人工智能 计算机视觉与模式识别

摘要

在许多应用中,视频内容摘要是一项重要任务。该任务可定义为计算视频中存在的动作的有序列表。此类列表可使用动作检测算法提取。然而,要知道动作的存在,并不必要确定其时间边界。此外,精确定位边界通常需要密集的视频分析才能有效。在本工作中,我们提出通过稀疏浏览视频并为每个动作实例选择一帧来直接计算该有序列表,这一任务在文献中被称为动作定位(action spotting)。为此,我们提出 ActionSpotter,一种利用深度强化学习(Deep Reinforcement Learning)在无需额外监督的情况下高效定位动作并自适应调整视频浏览速度的定位算法。在 THUMOS14 和 ActivityNet 数据集上的实验表明,我们的框架优于当前最先进的检测方法。特别地,THUMOS14 上的定位平均精度(mean Average Precision)从 59.7% 显著提升至 65.6%,同时跳过了 23% 的视频。

关键词

引用

@article{arxiv.2004.06971,
  title  = {ActionSpotter: Deep Reinforcement Learning Framework for Temporal Action Spotting in Videos},
  author = {Guillaume Vaudaux-Ruth and Adrien Chan-Hon-Tong and Catherine Achard},
  journal= {arXiv preprint arXiv:2004.06971},
  year   = {2020}
}