中文

AdaFrame:面向快速视频识别的自适应帧选择

计算机视觉与模式识别 2019-04-11 v2

摘要

我们提出 AdaFrame,一个在逐输入基础上自适应选择相关帧以实现快速视频识别的框架。AdaFrame 包含一个增强有全局记忆的长短期记忆网络,该全局记忆为随时间搜索使用哪些帧提供上下文信息。使用策略梯度方法训练,AdaFrame 在每个时间步生成预测、确定下一步观察哪一帧,并计算观看更多帧的效用(即期望未来奖励)。在测试时,AdaFrame 利用预测的效用实现自适应前瞻推理,从而在准确率不下降的情况下降低总体计算成本。我们在两个大规模视频基准 FCVID 和 ActivityNet 上进行了大量实验。AdaFrame 仅分别使用 8.21 和 8.65 帧即在 FCVID 和 ActivityNet 上达到使用全部帧的性能。我们进一步定性地证明,学习到的帧使用方式能够指示分类决策的难度;较易样本需要更少帧,而较难样本需要更多帧,这既体现在同一类别内的实例层面,也体现在不同类别间的类别层面。

关键词

引用

@article{arxiv.1811.12432,
  title  = {AdaFrame: Adaptive Frame Selection for Fast Video Recognition},
  author = {Zuxuan Wu and Caiming Xiong and Chih-Yao Ma and Richard Socher and Larry S. Davis},
  journal= {arXiv preprint arXiv:1811.12432},
  year   = {2019}
}

备注

CVPR 2019