中文

Aura:用于提升语音增强测试集多样性的隐私保护增强方法

音频与语音处理 2023-04-05 v3 密码学与安全 声音

摘要

运行在生产环境中的噪声抑制模型通常在公开可用数据集上训练。然而,这种方法由于缺乏对代表性客户数据的训练/测试而导致性能回退。此外,出于隐私原因,开发者无法收听客户内容。这种“不开耳”情形促使以隐私保护方式增强现有数据集。在本文中,我们提出 Aura,一种使现有噪声抑制测试集更具挑战性与多样性且样本高效的技术方案。Aura 是“不开耳”的,因为它依赖于特征提取器与语音质量度量 DNSMOS P.835,二者均在来自公开源的数据上预训练。作为 Aura 的一个应用,我们通过从 Librivox 的 20K 干净语音片段新批次与从 AudioSet 获取的噪声片段混合而来的新数据批次中采样音频文件,增强了 INTERSPEECH 2021 DNS 挑战赛。Aura 使现有基准测试集在 DNSMOS P.835 OVLR 上更难 0.27(7%),在 DNSMOS P.835 SIG 上更难 0.64(16%),多样性提升 31%,并且与随机采样相比在 Spearman 秩相关系数(SRCC)上取得 26% 的提升。最后,我们开源 Aura 以激发测试集开发的研究。

关键词

引用

@article{arxiv.2110.04391,
  title  = {Aura: Privacy-preserving Augmentation to Improve Test Set Diversity in Speech Enhancement},
  author = {Xavier Gitiaux and Aditya Khant and Ebrahim Beyrami and Chandan Reddy and Jayant Gupchup and Ross Cutler},
  journal= {arXiv preprint arXiv:2110.04391},
  year   = {2023}
}