通过分层多帧率分析实现高效视频理解
计算机视觉与模式识别
2018-11-27 v1 机器学习
机器学习
摘要
在为自动驾驶车辆与无人机设计实时感知系统时,最大的挑战之一是安全性(高预测精度)与效率之间的冲突需求。传统方法对整个系统使用单一帧率。受紧凑 ConvNet 架构对环境因子缺乏鲁棒性这一主要弱点的观察启发,我们提出了一种双帧率系统,兼取两者之长:一个调制流以低帧率执行对环境因子鲁棒的昂贵模型,以提取描述环境的缓慢变化特征;以及一个预测流以实时执行轻量模型,以提取描述当前帧特殊性的瞬态信号。我们设计的优势通过广泛的实证研究所验证,表明我们的方案在使用多种骨干架构选择与输入分辨率时带来一致的提升。这些发现表明,多帧率系统可作为自主智能体高效感知设计的一个有前景方向。
引用
@article{arxiv.1811.09834,
title = {Efficient Video Understanding via Layered Multi Frame-Rate Analysis},
author = {Ziyao Tang and Yongxi Lu and Tara Javidi},
journal= {arXiv preprint arXiv:1811.09834},
year = {2018}
}
备注
under review