Remixed2Remixed:通过基于重混的 Noise2Noise 学习进行语音增强的域自适应
声音
2023-12-29 v1 音频与语音处理
摘要
本文提出了Remixed2Remixed,一种用于语音增强的域自适应方法,该方法采用 Noise2Noise (N2N) 学习,将在人工生成的(域外:OOD)噪声-干净配对数据上训练的模型进行自适应,以更好地分离真实世界录制的(域内)含噪数据。所提出的方法使用在OOD数据上训练的教师模型来获取伪域内语音和噪声信号,在每个批次中对它们进行两次打乱和重混,以生成两个自举混合物。然后通过优化使用这两个自举混合物计算的基于N2N的代价函数来训练学生模型。由于训练策略类似于最近提出的RemixIT,我们还研究了基于N2N的损失作为RemixIT正则化的有效性。在CHiME-7对话语音增强无监督域自适应(UDASE)任务上的实验结果表明,所提出的方法优于挑战赛基线系统RemixIT,并减轻了由教师模型引起的性能模糊。
关键词
引用
@article{arxiv.2312.16836,
title = {Remixed2Remixed: Domain adaptation for speech enhancement by Noise2Noise learning with Remixing},
author = {Li Li and Shogo Seki},
journal= {arXiv preprint arXiv:2312.16836},
year = {2023}
}
备注
Accepted by ICASSP2024