利用多路音频信号中的冗余进行远场语音识别
音频与语音处理
2023-03-02 v1
摘要
为实现鲁棒的远场自动语音识别(ASR),现有技术通常采用声学前端(AFE)与神经转导器(NT)ASR 模型级联。然而,AFE 输出可能不可靠,因为 AFE 中的波束形成输出被导向错误方向。解决此问题的一个有前景的途径是利用 AFE 中波束形成之前以及声学回声消除之后(post-AEC)的麦克风信号。我们认为 post-AEC 与 AFE 输出是互补的,并且有可能利用这些信号间的冗余来补偿潜在的 AFE 处理错误。我们提出两种融合网络来探索此冗余并聚合这些多通道(MC)信号:(1)基于 Frequency-LSTM 的,以及(2)基于卷积神经网络(CNN)的融合网络。我们将 MC 融合网络增强到一个 conformer 转导器模型,并以端到端方式训练它。我们在商业虚拟助手任务上的实验结果表明,使用 AFE 输出与两路 post-AEC 信号配合融合网络,相较仅使用 AFE 输出的模型可带来至多 25.9% 的词错误率(WER)相对改善,代价为参数增加不超过 2%。
引用
@article{arxiv.2303.00692,
title = {Leveraging Redundancy in Multiple Audio Signals for Far-Field Speech Recognition},
author = {Feng-Ju Chang and Anastasios Alexandridis and Rupak Vignesh Swaminathan and Martin Radfar and Harish Mallidi and Maurizio Omologo and Athanasios Mouchtaris and Brian King and Roland Maas},
journal= {arXiv preprint arXiv:2303.00692},
year = {2023}
}