Knock-Knock:基于堆叠去噪自编码器的声学物体识别
计算机视觉与模式识别
2017-08-16 v1
摘要
本文展示了深度学习在基于声学数据的物体识别中的成功应用。以往采用手工特征描述声学数据的方法存在不足,包括限制了所找到的表示的广泛适用性,以及面临仅捕获对任务无关紧要特征的风险。相比之下,使用多层/深度学习架构方法时无需定义特征表示格式:可以从原始传感器数据中学习特征,而无需先验地定义判别性特征。本文应用堆叠去噪自编码器来训练深度学习模型。在我们的实验中,通过用记号笔敲击测试集中的每个物体 120 次以获取听觉数据,成功地对三十种不同的物体进行了分类。通过采用所提出的深度学习框架,实现了 91.50% 的高准确率。以使用手工特征和浅层分类器的传统方法作为基准,其识别率仅为 58.22%。有趣的是,当使用浅层分类器并以原始声学数据作为输入时,实现了 82.00% 的识别率。此外,我们证明了使用深度学习对一个物体进行分类所花费的时间远少于(超过 6 倍)使用传统方法的时间。本文还探讨了深度架构中不同模型参数对识别性能的影响。
引用
@article{arxiv.1708.04432,
title = {Knock-Knock: Acoustic Object Recognition by using Stacked Denoising Autoencoders},
author = {Shan Luo and Leqi Zhu and Kaspar Althoefer and Hongbin Liu},
journal= {arXiv preprint arXiv:1708.04432},
year = {2017}
}
备注
6 pages, 10 figures, Neurocomputing