DCF-DS:面向真实单通道条件的语音识别的深度级联说话人分离与语音分离融合
音频与语音处理
2024-12-31 v3 声音
摘要
我们提出了一种单通道深度级联说话人分离与语音分离融合(DCF-DS)框架,用于后端自动语音识别(ASR),结合了神经说话人分离(NSD)和语音分离(SS)。首先,我们在联合训练框架中依次集成NSD和SS模块,使分离模块能够有效利用说话人分离模块提供的说话人时间边界。然后,为补充DCF-DS训练,我们引入了一种窗口级解码方案,使DCF-DS框架能够处理稀疏数据收敛不稳定性(SDCI)问题。我们还探索了使用在真实数据集上训练的NSD系统来提供更精确的说话人边界。此外,我们在DCF-DS框架中集成了可选的多输入多输出语音增强模块(MIMO-SE),进一步提升了性能。最后,我们通过重新聚类DCF-DS输出来增强说话人分离结果,提升了ASR准确率。通过引入DCF-DS方法,我们在CHiME-8 NOTSOFAR-1挑战赛的现实单通道赛道中取得了第一名。我们还在开放LibriCSS数据集上进行了评估,实现了新的最先进单通道语音识别性能。
引用
@article{arxiv.2411.06667,
title = {DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions},
author = {Shu-Tong Niu and Jun Du and Ruo-Yu Wang and Gao-Bin Yang and Tian Gao and Jia Pan and Yu Hu},
journal= {arXiv preprint arXiv:2411.06667},
year = {2024}
}