中文

基于引导重混的持续自训练语音增强方法

声音 2022-11-14 v2 机器学习 音频与语音处理

摘要

我们提出 RemixIT,一种简单而新颖的用于语音增强的自监督训练方法。所提方法基于一种持续自训练方案,克服了先前研究的局限,包括对域内噪声分布的假设以及需要访问干净目标信号。具体而言,一个分离教师模型在域外数据集上预训练,并用于对一批域内混合信号推断估计目标信号。接下来,我们通过使用置换的估计干净与噪声信号生成人工混合来引导混合过程。最后,学生模型使用置换的估计源作为目标进行训练,同时我们定期用最新的学生模型更新教师权重。我们的实验表明,在多个语音增强任务下,RemixIT 优于几种先前的 SOTA 自监督方法。此外,RemixIT 为语音增强任务的半监督与无监督域适应提供了无缝替代方案,同时具有足够的通用性以应用于任何分离任务并与任何分离模型配对。

关键词

引用

@article{arxiv.2110.10103,
  title  = {Continual self-training with bootstrapped remixing for speech enhancement},
  author = {Efthymios Tzinis and Yossi Adi and Vamsi K. Ithapu and Buye Xu and Anurag Kumar},
  journal= {arXiv preprint arXiv:2110.10103},
  year   = {2022}
}

备注

To appear in Proc. ICASSP 2022, May 22-27, 2022, Singapore