中文

基于自监督数据增强与净化的个性化语音增强

音频与语音处理 2021-04-06 v1 机器学习 声音

摘要

由于隐私限制以及难以获取目标用户无噪语音,训练个性化语音增强模型本质上是一个零样本学习问题。若测试阶段用户有大量未标注的含噪语音,则可以利用自监督学习来训练个性化语音增强模型。一种直接的个性化方法是使用该目标说话人的含噪录音作为伪源,随后一个伪去噪模型学习去除注入的训练噪声并恢复伪源。然而,该方法不稳定,因其依赖于伪源的质量,而伪源可能过于嘈杂。作为补救,我们提出通过数据净化改进自监督方法。我们首先训练一个 SNR 预测模型来估计伪源的逐帧 SNR,然后将预测值转换为权重,用以调整伪源对个性化模型训练的逐帧贡献。我们通过实验表明,所提出的数据净化步骤提升了说话人特定含噪数据在个性化语音增强中的可用性。在不依赖任何干净语音录音或说话人嵌入的情况下,我们的方法可视为保护隐私的。

关键词

引用

@article{arxiv.2104.02018,
  title  = {Personalized Speech Enhancement through Self-Supervised Data Augmentation and Purification},
  author = {Aswin Sivaraman and Sunwoo Kim and Minje Kim},
  journal= {arXiv preprint arXiv:2104.02018},
  year   = {2021}
}

备注

5 pages, 3 figures, under review