用于联合声学回声消除、语音增强与语音分离的基于Conformer的ASR前端
音频与语音处理
2021-11-22 v1 声音
摘要
我们提出一种用于提升自动语音识别(ASR)鲁棒性的前端,其在单一模型中联合实现三个模块:声学回声消除、语音增强和语音分离。这是通过使用上下文增强神经网络实现的,该网络可有选择地利用不同类型的辅助输入:(1)播放音频的参考信号,其为回声消除所必需;(2)噪声上下文,其对语音增强有用;(3)表示目标说话人语音特征的嵌入向量,其不仅在语音分离中关键,也有助于回声消除和语音增强。我们给出详细评估,表明联合模型性能几乎与任务专用模型相当,并且即使使用大规模最先进ASR模型,在噪声条件下也显著降低了词错误率。与噪声基线相比,联合模型在我们的回声消除数据集上低信噪比条件下词错误率降低至少71%,在噪声数据集上降低10%,在多说话人数据集上降低26%。与任务专用模型相比,联合模型在回声消除数据集上差距在10%以内,在噪声数据集上差距2%,在多说话人数据集上差距3%。
引用
@article{arxiv.2111.09935,
title = {A Conformer-based ASR Frontend for Joint Acoustic Echo Cancellation, Speech Enhancement and Speech Separation},
author = {Tom O'Malley and Arun Narayanan and Quan Wang and Alex Park and James Walker and Nathan Howard},
journal= {arXiv preprint arXiv:2111.09935},
year = {2021}
}
备注
Will appear in IEEE-ASRU 2021