基于四元数神经网络的语音识别
音频与语音处理
2018-11-27 v1 声音
机器学习
摘要
神经网络架构是强大的自动语音识别系统(ASR)的核心。然而,尽管近期研究聚焦于新颖的模型架构,声学输入特征几乎未变。传统 ASR 系统依赖多维声学特征,如梅尔滤波器组能量以及一阶和二阶差分,来刻画组成信号序列的时间帧。考虑到这些分量描述了同一元素的不同视图,神经网络必须学习这些特征内部存在的内在关系,以及时间帧之间存在的外部或全局依赖。四元数值神经网络(QNN)近来受到研究者的重视,用于在多维空间中处理和学习的此类关系。事实上,四元数及 QNN 已显示出其将多维输入作为整体处理的效率、编码内部依赖的能力,以及以多达四倍少于实值模型的学习参数解决许多任务的本领。我们提议在 TIMIT 数据集的语音识别背景下研究现代四元数值模型,如卷积和循环四元数神经网络。实验表明,QNN 始终以远少得多的自由参数优于实值等价模型,从而实现相关信息的更高效、紧凑且更具表现力的表示。
引用
@article{arxiv.1811.09678,
title = {Speech recognition with quaternion neural networks},
author = {Titouan Parcollet and Mirco Ravanelli and Mohamed Morchid and Georges Linarès and Renato De Mori},
journal= {arXiv preprint arXiv:1811.09678},
year = {2018}
}
备注
NIPS 2018 (IRASL). arXiv admin note: text overlap with arXiv:1806.04418