中文

Zeus:利用强化学习高效定位视频中的动作

计算机视觉与模式识别 2022-09-29 v3 数据库

摘要

视频中动作的检测与定位是一个重要的实际问题。最先进的视频分析系统无法高效且有效地回答此类动作查询,因为动作通常涉及对象之间复杂的交互并分布在一系列帧中;检测和定位它们需要计算代价高昂的深度神经网络。为了有效回答查询,考虑整个帧序列也很重要。在本文中,我们提出 ZEUS,一种专为回答动作查询而定制的视频分析系统。我们提出了一种利用深度强化学习高效回答这些查询的新技术。ZEUS 训练一个强化学习智能体,该智能体学习自适应地修改随后送入动作分类网络的输入视频片段。该智能体沿三个维度改变输入片段——采样率、片段长度和分辨率。为了满足用户指定的精度目标,ZEUS 的查询优化器基于感知精度的聚合奖励函数训练该智能体。在三个多样化视频数据集上的评估表明,ZEUS 分别比最先进的基于帧和基于窗口的过滤技术高出多达 22.1 倍和 4.7 倍。它还在所有查询中始终满足用户指定的精度目标。

关键词

引用

@article{arxiv.2104.06142,
  title  = {Zeus: Efficiently Localizing Actions in Videos using Reinforcement Learning},
  author = {Pramod Chunduri and Jaeho Bang and Yao Lu and Joy Arulraj},
  journal= {arXiv preprint arXiv:2104.06142},
  year   = {2022}
}