中文

LiteEval:一种用于资源高效视频识别的由粗到细框架

计算机视觉与模式识别 2019-12-04 v1

摘要

本文提出 LiteEval,一个简单而有效的由粗到细框架,用于资源高效的视频识别,适用于在线与离线场景。LiteEval 利用轻量 CNN 模型在粗尺度上导出的得体但计算高效的特征,动态地在线上决定是否在更细尺度上为 incoming 视频帧计算更强大的特征以获取更多细节。这通过一个粗 LSTM 与一个细 LSTM 协同工作,以及一个条件门控模块来学习何时分配更多计算而实现。我们在两个大规模视频基准 FCVID 和 ActivityNet 上进行了大量实验,结果表明 LiteEval 在在线与离线预测中均仅需大幅更少的计算量,同时提供优异的分类精度。

关键词

引用

@article{arxiv.1912.01601,
  title  = {LiteEval: A Coarse-to-Fine Framework for Resource Efficient Video Recognition},
  author = {Zuxuan Wu and Caiming Xiong and Yu-Gang Jiang and Larry S. Davis},
  journal= {arXiv preprint arXiv:1912.01601},
  year   = {2019}
}

备注

NeurIPS 2019