通过解耦说话人分离与语音识别提升稳健多说话人自动语音识别性能
声音
2025-03-25 v1 音频与语音处理
摘要
尽管自动语音识别 (ASR) 在深度学习的引入后取得了巨大成功,但在许多真实世界的多说话人场景中,其性能仍不令人满意。说话人分离在分离各个说话人方面表现卓越,但作为前端,它会引入处理性瑕疵,导致在洁净语音上训练的 ASR 后端性能下降。因此,主流的稳健 ASR 系统会在带噪语音上训练后端以避免处理性瑕疵。本文提出解耦说话人分离前端和 ASR 后端的训练方式,后者仅在洁净语音上训练。我们解耦系统在 Libri2Mix dev/test 集合上实现了 5.1% 的词错误率 (WER),显著优于其他多说话人 ASR baseline。其效果也在 1-ch 和 6-ch SMS-WSJ 上以 7.60%/5.74% 的 SOTA WER 得以证明。此外,在记录的 LibriCSS 上,我们实现了 2.92% 的 speaker-attributed WER。这些 SOTA 结果表明,解耦说话人分离与语音识别是提升稳健多说话人 ASR 有效途径。
引用
@article{arxiv.2503.17886,
title = {Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition},
author = {Yufeng Yang and Hassan Taherian and Vahid Ahmadi Kalkhorani and DeLiang Wang},
journal= {arXiv preprint arXiv:2503.17886},
year = {2025}
}