中文

Mic2Mic:利用循环一致生成对抗网络克服语音系统中的麦克风差异性

音频与语音处理 2020-03-30 v1 机器学习 声音 机器学习

摘要

移动与嵌入式设备正日益使用麦克风及基于音频的计算模型来推断用户上下文。构建结合音频模型与商用麦克风的系统的首要挑战在于保证其在真实世界中的准确性与鲁棒性。除诸多环境动态因素外,影响音频模型鲁棒性的主要因素是麦克风差异性。本工作中,我们提出Mic2Mic——一个机器学习系统组件——其驻留于音频模型的推理流水线中,并以实时方式降低由麦克风特定因素引起的音频数据差异性。Mic2Mic设计的两个关键考量是:a) 将麦克风差异性问题与音频任务解耦,以及 b) 对终端用户提供训练数据的负担最小化。鉴于此,我们应用循环一致生成对抗网络(CycleGANs)的原理,利用从不同麦克风收集的无标签且未配对的数据来学习Mic2Mic。我们的实验表明,对于两个常见音频任务,Mic2Mic可恢复因麦克风差异性而损失的准确度的66%至89%。

关键词

引用

@article{arxiv.2003.12425,
  title  = {Mic2Mic: Using Cycle-Consistent Generative Adversarial Networks to Overcome Microphone Variability in Speech Systems},
  author = {Akhil Mathur and Anton Isopoussu and Fahim Kawsar and Nadia Berthouze and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2003.12425},
  year   = {2020}
}

备注

Published at ACM IPSN 2019