深度神经网络在语音与视觉系统中的综述
计算机视觉与模式识别
2019-12-03 v2 机器学习
神经与进化计算
声音
音频与语音处理
信号处理
机器学习
摘要
本综述回顾了视觉与语音应用中最先进的深度神经网络架构、算法与系统。深度人工神经网络算法与架构的最新进展推动了智能视觉与语音系统的快速创新与发展。借助海量传感器数据以及用于深度神经网络处理与训练的云计算,加之移动与嵌入式技术日益复杂,下一代智能系统有望彻底改变个人与商业计算。本综述首先提供迄今最成功的智能视觉与语音深度学习模型的背景与演进。我们概述了大规模工业研发工作,以强调智能视觉与语音系统的未来趋势与前景。鲁棒且高效的智能系统要求在资源受限的硬件平台(如移动设备、机器人和汽车)上具备低延迟与高保真度。因此,本综述还总结了在受限硬件平台(即有限内存、电池续航和处理能力内)运行深度神经网络的关键挑战与近期成果。最后,讨论了视觉与语音在情感计算、智能交通和精准医疗等跨学科中的新兴应用。据我们所知,本文从软件与硬件系统双视角对智能视觉与语音应用的最新进展提供了最为全面的综述之一。许多使用深度神经网络的新兴技术展现出彻底变革未来视觉与语音系统研发的巨大力。
引用
@article{arxiv.1908.07656,
title = {Survey on Deep Neural Networks in Speech and Vision Systems},
author = {Mahbubul Alam and Manar D. Samad and Lasitha Vidyaratne and Alexander Glandon and Khan M. Iftekharuddin},
journal= {arXiv preprint arXiv:1908.07656},
year = {2019}
}