用于视频识别与强化学习的快速视网膜形态事件流
计算机视觉与模式识别
2018-05-22 v2
摘要
良好的时间表示对视频理解至关重要,最先进的视频识别框架基于双流网络。在此类框架中,除了负责 RGB 帧输入的常规 ConvNets 外,还引入了第二个网络来处理时间表示,通常是光流(OF)。然而,OF 或其他面向任务的流计算代价高昂,因此通常在预处理阶段计算。关键的是,这阻碍了双流方法应用于强化学习(RL)应用(如视频游戏玩耍),其中下一状态依赖于当前状态和动作选择。受哺乳动物和昆虫早期视觉系统的启发,我们提出了一种快速事件驱动表示(EDR),其建模了早期视网膜回路的几个主要特性:(1)对数输入响应,(2)多时间尺度时间平滑以滤除噪声,以及(3)用于原始事件检测的双极(ON/OFF)通路[12]。以方向信息换取快速(> 9000 fps),EDR 能够在需要与世界交互的智能体视频应用(如游戏玩耍、虚拟机器人和域适应)中实现快速实时推理/学习。为此,我们使用 EDR 展示了在 Atari 游戏上优于最先进强化学习算法的性能,这是预计算 OF 所无法实现的。此外,通过 UCF-101 视频动作识别实验,我们表明 EDR 在准确率上接近最先进水平,同时输入表示处理实现了相比光流 1,500 倍的加速。
引用
@article{arxiv.1805.06374,
title = {Fast Retinomorphic Event Stream for Video Recognition and Reinforcement Learning},
author = {Wanjia Liu and Huaijin Chen and Rishab Goel and Yuzhong Huang and Ashok Veeraraghavan and Ankit Patel},
journal= {arXiv preprint arXiv:1805.06374},
year = {2018}
}