SuperM2M:基于监督学习和混合-混合协学习的语音增强与抗噪语音识别
音频与语音处理
2025-03-25 v3 信号处理
摘要
当前神经语音增强的主导方法基于监督式学习,使用仿真训练数据。但训练得到的模型常常对真实录制数据泛化能力有限。为此,本文考察了直接在真实目标域数据上训练增强模型的做法。我们提出了将混合-混合(M2M)训练(原用于说话人分离)适用于语音增强的方法,通过将多源噪声信号建模为单个组合源。此外,我们提出了一种协学习算法,通过监督式算法帮助改进 M2M。当可获得训练时的近端和远端混合信号时,M2M 通过训练深度神经网络(DNN)来产生语音和噪声估计,使得它们可以线性滤波以重构近端和远端混合信号。如此一来,DNN 可直接在真实混合信号上进行训练,并利用近端和远端混合信号作为弱监督来增强远端混合信号。为改进 M2M,我们将其与监督方法结合进行协训练,交替喂入真实的近端和远端混合对以及仿真的混合信号和干净语音的 mini-batch,并分别使用(a)真实近端和远端混合信号的混合重构损失和(b)仿真干净语音和噪声的常规增强损失。我们发现,通过这种方式,DNN 能从真实数据和仿真数据中学习,以实现对真实数据的更好泛化。我们称该算法为 SuperM2M(监督式与混合-混合协学习)。在 CHiME-4 数据集上的评估结果表明,其有效性和潜力。
引用
@article{arxiv.2403.10271,
title = {SuperM2M: Supervised and Mixture-to-Mixture Co-Learning for Speech Enhancement and Noise-Robust ASR},
author = {Zhong-Qiu Wang},
journal= {arXiv preprint arXiv:2403.10271},
year = {2025}
}
备注
in Neural Networks