通过自监督学习实现高效个性化语音增强
音频与语音处理
2022-07-28 v2 机器学习
声音
摘要
本工作提出用于开发单声道说话人特定(即个性化)语音增强模型的自监督学习方法。通用模型必须广泛应对许多说话人,而专用模型可将其增强函数适配于特定说话人的声音,有望解决更窄的问题。因此,专用模型除降低计算复杂度外,还能实现更优性能。然而,朴素的个性化方法可能需要目标用户的干净语音,这不易获取,例如由于欠佳的录音条件。为此,我们将个性化视为零样本任务(训练时不使用该目标说话人的额外干净语音)或少样本学习任务(目标是最小化用于迁移学习的干净语音时长)。本文中,我们提出自监督学习方法作为零样本与少样本个性化任务的解决方案。所提方法旨在从未标记数据(即来自目标用户的真实场景噪声录音)中学习个性化语音特征,而无需知道相应干净源。我们的实验研究了三种不同的自监督学习机制。结果表明,自监督模型以更少的模型参数和目标用户的干净数据实现了零样本和少样本个性化,达成了数据效率与模型压缩目标。
引用
@article{arxiv.2104.02017,
title = {Efficient Personalized Speech Enhancement through Self-Supervised Learning},
author = {Aswin Sivaraman and Minje Kim},
journal= {arXiv preprint arXiv:2104.02017},
year = {2022}
}
备注
15 pages, 9 figures, published in IEEE JSTSP 2022