基于多智能体强化学习的帧采样用于有效未修剪视频识别
计算机视觉与模式识别
2019-08-05 v2
摘要
视频识别已引起极大的研究兴趣并取得了巨大进展。合适的帧采样策略可以提高识别的准确性和效率。然而,主流方案通常采用手工设计的帧采样策略进行识别。由于帧级显著性的变化,这可能会降低性能,尤其是在未修剪视频中。为此,我们专注于通过开发基于学习的帧采样策略来改进未修剪视频分类。我们直观地将帧采样过程表述为多个并行的马尔可夫决策过程,每个过程旨在通过逐步调整初始采样挑选出一帧/片段。然后我们提出用多智能体强化学习(MARL)来解决这些问题。我们的 MARL 框架由一个新颖的基于 RNN 的上下文感知观测网络(联合建模邻近智能体间的上下文信息和特定智能体的历史状态)、一个策略网络(在每一步生成预定义动作空间上的概率分布)以及一个用于奖励计算和最终识别的分类网络组成。大量实验结果表明,我们的基于 MARL 的方案以各种 2D 和 3D 基线方法显著优于手工设计的策略。我们的单一 RGB 模型在 ActivityNet v1.3 冠军提交(多模态多模型融合)上取得了可比的性能,并在 YouTube Birds 和 YouTube Cars 上取得了新的最先进结果。
引用
@article{arxiv.1907.13369,
title = {Multi-Agent Reinforcement Learning Based Frame Sampling for Effective Untrimmed Video Recognition},
author = {Wenhao Wu and Dongliang He and Xiao Tan and Shifeng Chen and Shilei Wen},
journal= {arXiv preprint arXiv:1907.13369},
year = {2019}
}
备注
Accepted by ICCV 2019 (oral)