中文

跟踪作为在线决策:利用强化学习从流式视频中学习策略

计算机视觉与模式识别 2017-07-18 v1

摘要

我们将跟踪表述为一个在线决策过程,其中跟踪代理必须在图像帧模糊且计算预算有限的情况下跟随目标。关键在于,代理必须决定在后续帧中看向何处、何时因认为目标丢失而重新初始化,以及何时更新被跟踪目标的外观模型。此类决策通常依靠启发式方法做出。相反,我们提议通过将跟踪表述为部分可观测决策过程 (POMDP) 来学习最优决策策略。我们利用深度强化学习算法学习策略,这些算法仅在跟踪出错时需要监督(奖励信号)。我们证明稀疏奖励使我们能够在海量数据集上快速训练,其规模比过去的工作大几个数量级。有趣的是,通过将互联网视频的数据源视为无限流,我们在单一统一的计算流中同时学习和评估我们的跟踪器。

关键词

引用

@article{arxiv.1707.04991,
  title  = {Tracking as Online Decision-Making: Learning a Policy from Streaming Videos with Reinforcement Learning},
  author = {James Steven Supancic and Deva Ramanan},
  journal= {arXiv preprint arXiv:1707.04991},
  year   = {2017}
}