用于远场语音识别的三维特征与声学建模
音频与语音处理
2020-01-28 v2 机器学习
声音
摘要
多通道混响条件下的自动语音识别是一项具有挑战性的任务。抑制混响伪影的常规方法涉及基于波束形成的多通道语音信号增强,用于为神经网络声学模型提取基于谱图的特征。在本文中,我们提出使用多元自回归(MAR)建模方法直接从多通道语音信号提取特征,其中利用了时间、频率和通道所有三个维度间的相关性。MAR 特征被送入卷积神经网络(CNN)架构,该架构在三个维度上执行联合声学建模。三维 CNN 架构允许组合多通道特征,与专注于增强任务的传统波束形成模型相比,优化了语音识别代价。实验在 CHiME-3 和 REVERB Challenge 数据集上使用多通道混响语音进行。在这些实验中,所提出的三维特征与声学建模方法相比以波束形成音频训练的 ASR 系统提供了显著改进(在 CHiME-3 和 REVERB Challenge 数据集上词错误率平均相对改进分别为 10% 和 9%)。
引用
@article{arxiv.1911.05504,
title = {3-D Feature and Acoustic Modeling for Far-Field Speech Recognition},
author = {Anurenjan Purushothaman and Anirudh Sreeram and Sriram Ganapathy},
journal= {arXiv preprint arXiv:1911.05504},
year = {2020}
}