一种可通用部署的用于联合声学回声消除、语音增强与语音分离的ASR前端
音频与语音处理
2022-09-15 v1 声音
摘要
近期研究表明,训练单一模型来执行联合声学回声消除(AEC)、语音增强与语音分离是可行的,从而可作为鲁棒自动语音识别(ASR)的统一前端。该联合模型利用上下文信息,例如播放音频的参考信号、噪声上下文与说话人嵌入。在本工作中,我们对这类模型提出若干新颖改进。首先,我们改进了用于将噪声上下文注入模型的Cross-Attention Conformer架构。其次,我们将模型泛化以能够处理不同长度的噪声上下文。第三,我们提出Signal Dropout,一种对缺失上下文信息进行建模的新策略。在一个或多个信号缺失的情况下,所提模型的表现几乎与不使用这些信号训练的任务专用模型相当;而当这些信号存在时,我们的系统与那些需要全部上下文信号的系统相比表现良好。相较于基线,最终模型在缺失说话人嵌入时对背景语音保持了25.0%的相对词错误率降低,在缺失设备播放时于AEC上保持了61.2%的相对词错误率降低。
引用
@article{arxiv.2209.06410,
title = {A Universally-Deployable ASR Frontend for Joint Acoustic Echo Cancellation, Speech Enhancement, and Voice Separation},
author = {Tom O'Malley and Arun Narayanan and Quan Wang},
journal= {arXiv preprint arXiv:2209.06410},
year = {2022}
}