中文

基于深度 CNN 的显著性驱动自我中心视频物体识别

计算机视觉与模式识别 2016-06-24 v1

摘要

自然场景中的物体识别问题近来已通过深度卷积神经网络得到成功解决,在识别分数上取得了显著突破。深度 CNN 的计算效率随其深度变化,使其可用于实时应用。这里的关键问题之一是减少从图像中选取并提交给深度 CNN 的窗口数量。这通常通过初步分割和选择具有突出“物体性”或其他指示物体可能位置指标的特定窗口来解决。在本文中,我们提出了一种深度 CNN 方法及通用框架,用于在实时场景和自我中心视角下识别物体。此处,感兴趣窗口是基于视觉注意力图构建的,该注意力图由眼镜式眼动仪测量的注视点计算得出。此设置的应用是为上肢截肢者提供一个交互式用户友好环境。当肌电控制因剩余肌肉量过少而失效时,视觉必须帮助受试者控制其佩戴的神经假肢。在一个专门录制的包含 151 个简单几何物体视频的语料库上,识别结果显示 mAP 为 64.6%,且泛化时的计算时间低于对感兴趣物体的单次视觉注视时间。

关键词

引用

@article{arxiv.1606.07256,
  title  = {Saliency Driven Object recognition in egocentric videos with deep CNN},
  author = {Philippe Pérez de San Roman and Jenny Benois-Pineau and Jean-Philippe Domenger and Florent Paclet and Daniel Cataert and Aymar de Rugy},
  journal= {arXiv preprint arXiv:1606.07256},
  year   = {2016}
}

备注

20 pages, 8 figures, 3 tables, Submitted to the Journal of Computer Vision and Image Understanding