基于卷积神经网络的端到端音素序列识别
机器学习
2013-12-10 v1 计算与语言
神经与进化计算
摘要
大多数最先进的音素识别系统依赖于经典的神经网络分类器,并输入经过高度调优的特征,如 MFCC 或 PLP 特征。近期“深度学习”方法的进展对这些系统提出了质疑,尽管已有尝试使用频谱图等更简单的特征,但最先进的系统仍依赖于 MFCC。这或许被视为深度学习方法的一种失败,因为它们常被宣称能够直接利用原始信号进行训练,从而无需手工设计的特征。在本文中,我们研究了一种针对原始语音信号的卷积神经网络方法。虽然卷积架构在计算机视觉或文本处理领域取得了巨大成功,但在过去几年的语音处理领域似乎遭遇了挫折。我们表明,可以直接从原始信号学习端到端的音素序列分类系统,其在 TIMIT 和 WSJ 数据集上的性能与基于 MFCC 的现有系统相当,从而质疑了在大规模数据集上使用复杂手工设计特征的必要性。
引用
@article{arxiv.1312.2137,
title = {End-to-end Phoneme Sequence Recognition using Convolutional Neural Networks},
author = {Dimitri Palaz and Ronan Collobert and Mathew Magimai. -Doss},
journal= {arXiv preprint arXiv:1312.2137},
year = {2013}
}
备注
NIPS Deep Learning Workshop, 2013