面向基于图像和视频识别的端到端自动化系统设计
计算机视觉与模式识别
2016-01-29 v1
摘要
几十年来,从事物体识别的研究人员一直渴望拥有一个端到端自动化系统,该系统简单地接受2D或3D图像或视频作为输入,并输出输入数据中物体的标签。利用基于几何、辐射度和神经考量导出的表示以及统计与结构匹配器的计算机视觉方法,以及基于人工神经网络的方法(其中多层网络学习从输入到类标签的映射),为图像识别问题提供了相互竞争的途径。在过去的四年中,基于深度卷积神经网络(DCNNs)的方法在目标检测/识别挑战问题上展现出令人印象深刻的性能提升。这得益于大型标注数据的可用性、对图像与类标签之间非线性映射的更好理解以及GPU的可负担性。在本文中,我们简要回顾了过去四十年中计算机视觉与人工神经网络在基于图像的识别问题上的发展历史。随后,我们给出了一个用于端到端无约束人脸验证/识别的深度学习系统的设计细节。接着讨论了关于用于物体识别问题的DCNNs的一些开放问题。我们提醒读者,本文所表达的观点仅代表作者本人的观点!
引用
@article{arxiv.1601.07883,
title = {Towards the Design of an End-to-End Automated System for Image and Video-based Recognition},
author = {Rama Chellappa and Jun-Cheng Chen and Rajeev Ranjan and Swami Sankaranarayanan and Amit Kumar and Vishal M. Patel and Carlos D. Castillo},
journal= {arXiv preprint arXiv:1601.07883},
year = {2016}
}
备注
7 pages