用于视频视觉目标跟踪的深度强化学习
计算机视觉与模式识别
2017-04-12 v2 机器学习
摘要
本文介绍了一种用于视频视觉跟踪的全端到端方法,该方法学习预测每帧中目标对象的边界框位置。一个重要的见解是,跟踪问题可被视为顺序决策过程,且历史语义编码了与未来决策高度相关的信息。基于这一直觉,我们将模型表述为与视频随时间交互的循环卷积神经网络智能体,并且我们的模型可利用强化学习(RL)算法进行训练,以学习良好的跟踪策略,这些策略关注连续的帧间相关性并长期最大化跟踪性能。所提出的跟踪算法在现有跟踪基准上达到了最先进的性能,并以高于实时的帧率运行。据我们所知,我们的跟踪器是首个将卷积网络与循环网络同 RL 算法相结合的神经网络跟踪器。
引用
@article{arxiv.1701.08936,
title = {Deep Reinforcement Learning for Visual Object Tracking in Videos},
author = {Da Zhang and Hamid Maei and Xin Wang and Yuan-Fang Wang},
journal= {arXiv preprint arXiv:1701.08936},
year = {2017}
}