使用真实语音训练的桥接模块缩小预训练语音增强与识别模型之间的差距
声音
2025-01-07 v1 音频与语音处理
摘要
单通道语音增强(SE)所造成的信息损失或失真会损害自动语音识别(ASR)的性能。观测值相加(OA)是一种有效的后处理方法,可通过平衡带噪语音与增强语音来提升 ASR 性能。确定 OA 系数至关重要。然而,当前有监督的 OA 系数模块(即桥接模块)仅利用模拟带噪语音进行训练,这与真实带噪语音之间存在严重的失配。在本文中,我们提出了使用真实带噪语音训练桥接模块的训练策略。首先,选用 DNSMOS 来评估真实带噪语音的感知质量,无需相应的干净标签即可训练桥接模块。训练过程中引入了额外的约束以进一步增强桥接模块的鲁棒性。每条语句由 ASR 后端使用不同的 OA 系数进行评估,以获得词错误率(WERs)。这些 WERs 被用于构建一个多维向量。该向量通过多任务学习被引入桥接模块,并用于确定最优的 OA 系数。在 CHiME-4 数据集上的实验结果表明,与使用模拟数据训练的桥接模块相比,所提出的方法均取得了显著提升,尤其是在真实评估集上。
引用
@article{arxiv.2501.02452,
title = {Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module},
author = {Zhongjian Cui and Chenrui Cui and Tianrui Wang and Mengnan He and Hao Shi and Meng Ge and Caixia Gong and Longbiao Wang and Jianwu Dang},
journal= {arXiv preprint arXiv:2501.02452},
year = {2025}
}