中文

面向个性化语音增强的测试时自适应:基于知识蒸馏的零样本学习

音频与语音处理 2021-05-11 v1 机器学习 声音

摘要

在终端用户设备的现实语音增强场景中,我们常遇到仅少数说话人与噪声类型、且倾向于在特定声学环境中反复出现的情况。我们提出一种新颖的个性化语音增强方法,将紧凑的去噪模型适配至测试时的特异性。该测试时自适应的目标是不使用测试说话人的任何干净语音目标,从而满足零样本学习的要求。为弥补干净语音的缺失,我们采用知识蒸馏框架。我们以从过大的教师模型蒸馏出的更先进的去噪结果作为伪目标来训练小型学生模型,替代缺失的干净语音目标。该零样本学习流程规避了收集用户干净语音的过程,而用户因隐私顾虑与录制干净人声的技术难度往往不愿配合此过程。在各种测试时条件下的实验表明,所提出的个性化方法相比从大规模说话人与噪声无关数据集训练出的更大基线网络取得了显著的性能提升。此外,由于紧凑的个性化模型可优于更大的通用模型,我们主张所提方法实现了无去噪性能损失的模型压缩。

关键词

引用

@article{arxiv.2105.03544,
  title  = {Test-Time Adaptation Toward Personalized Speech Enhancement: Zero-Shot Learning with Knowledge Distillation},
  author = {Sunwoo Kim and Minje Kim},
  journal= {arXiv preprint arXiv:2105.03544},
  year   = {2021}
}

备注

5 pages, 5 figures, under review