使用原始波形信号的多跨度声学建模
音频与语音处理
2019-10-10 v2 机器学习
声音
机器学习
摘要
传统自动语音识别(ASR)系统常使用基于手工声学特征的声学模型(AM),如对数梅尔滤波器组(FBANK)值。近期研究发现,带有卷积神经网络(CNNs)的AM可直接使用原始波形信号作为输入。在充足训练数据下,这些AM可取得与基于FBANK特征的AM相竞争的词错误率(WER)。本文提出一种基于原始波形的新颖多跨度结构用于声学建模,其具有多流CNN输入层,各流处理原始波形信号的不同跨度。在单通道CHiME4和AMI数据集上的评估显示,多跨度AM比FBANK AM平均降低约5%(相对)的WER。对训练后多跨度模型的分析揭示,CNN可学习到与对数梅尔滤波器相当不同的滤波器。此外,本文表明广泛使用的单跨度原始波形AM可通过使用更小CNN核尺寸与增大步长来改进,从而获得更优WER。
引用
@article{arxiv.1906.11047,
title = {Multi-Span Acoustic Modelling using Raw Waveform Signals},
author = {Patrick von Platen and Chao Zhang and Philip Woodland},
journal= {arXiv preprint arXiv:1906.11047},
year = {2019}
}
备注
To appear in INTERSPEECH 2019