中文

RemixIT:基于引导重混音的语音增强模型持续自训练方法

声音 2022-08-30 v3 机器学习 音频与语音处理

摘要

我们提出 RemixIT,一种简单而有效的自监督语音增强训练方法,无需任何孤立的域内语音波形或噪声波形。我们的方法克服了先前方法的局限性,那些方法依赖于干净的域内目标信号,因而对训练与测试样本间的任何域失配都十分敏感。RemixIT 基于一种连续自训练方案:首先在域外数据上预训练的教师模型为域内混合信号推断估计的伪目标信号;随后通过对估计的干净信号与噪声信号进行置换并重新混合,生成一组新的引导混合信号及相应伪目标,用于训练学生网络。反之,教师模型定期利用最新学生模型的更新参数来精炼其估计。在多个语音增强数据集与任务上的实验结果表明,我们的方法不仅优于先前方法,还展示出 RemixIT 可与任意分离模型结合,并适用于任何半监督与无监督域适应任务。我们的分析结合实证证据,揭示了该自训练方案的内部运作机制:学生模型在观察到严重退化的伪目标时仍能持续获得更优性能。

关键词

引用

@article{arxiv.2202.08862,
  title  = {RemixIT: Continual self-training of speech enhancement models via bootstrapped remixing},
  author = {Efthymios Tzinis and Yossi Adi and Vamsi Krishna Ithapu and Buye Xu and Paris Smaragdis and Anurag Kumar},
  journal= {arXiv preprint arXiv:2202.08862},
  year   = {2022}
}

备注

To appear in IEEE Journal of Selected Topics in Signal Processing