中文

基于云的利用方向融合与卷积神经网络的可扩展视频流目标识别

计算机视觉与模式识别 2021-06-30 v1

摘要

来自实时视频流的目标识别面临诸多挑战,如光照条件和姿态的变化。卷积神经网络(CNNs)已被广泛用于执行智能视觉目标识别。然而,CNNs仍遭受严重的精度下降,尤其在光照变化数据集上。为解决此问题,我们提出一种基于方向融合的CNN新方法用于视觉目标识别。所提出的基于云的视频分析系统首创性地使用二维经验模态分解将视频帧分解为固有模态函数(IMFs)。我们进一步提出对这些IMFs进行Reisz变换以产生单演目标分量,进而用于CNN的训练。已有工作证明了目标方向分量如何将精度提升至高达93\%。本文中我们展示了方向分量的特征融合策略如何进一步将视觉识别精度提升至97\%。我们还评估了方法的可扩展性,考察了所受关注视频流的数量与大小。我们在公开可用的Yale数据集及自建视频数据集上进行了大量实验,发现相比AlexNet、LeNet和SE-ResNeXt这三种最常用的视觉目标识别与分类深度学习模型,取得了显著改进(在精度和规模上)。

关键词

引用

@article{arxiv.2106.15329,
  title  = {Cloud based Scalable Object Recognition from Video Streams using Orientation Fusion and Convolutional Neural Networks},
  author = {Muhammad Usman Yaseen and Ashiq Anjum and Giancarlo Fortino and Antonio Liotta and Amir Hussain},
  journal= {arXiv preprint arXiv:2106.15329},
  year   = {2021}
}