基于对比混合的自监督学习用于个性化语音增强
音频与语音处理
2022-08-11 v2 机器学习
声音
摘要
本工作探索了如何普遍地使用自监督学习来发现说话人特定特征,以实现个性化语音增强模型。我们具体解决了少样本学习场景:测试时说话人的干净录音仅可获取几秒,但该说话人的含噪录音十分丰富。我们提出了一种简单的对比学习过程,通过成对噪声注入将丰富的含噪数据作为临时训练目标:模型被预训练为最大化不同形变的相同语句对之间的一致性,并最小化相似形变的相异语句对之间的一致性。我们的实验将所提出的预训练方法与两种基线替代方案进行比较:说话人无关的全监督预训练,以及不含对比损失项的说话人特定自监督预训练。在三种方法中,所提出的采用对比混合的方法被证明对模型压缩(参数减少 85%)和干净语音减少(仅需 3 秒)最为鲁棒。
引用
@article{arxiv.2011.03426,
title = {Self-Supervised Learning from Contrastive Mixtures for Personalized Speech Enhancement},
author = {Aswin Sivaraman and Minje Kim},
journal= {arXiv preprint arXiv:2011.03426},
year = {2022}
}
备注
This work has been superseded by article 2104.02017