中文

语音增强生成对抗网络中的语言与噪声迁移

声音 2017-12-19 v1 机器学习 音频与语音处理

摘要

语音增强深度学习系统通常需要大量训练数据以在宽泛条件或真实应用中运行。这使得这些系统适配新的、低资源环境成为一个重要课题。在本工作中,我们展示了通过使用少量数据微调生成器来适配语音增强生成对抗网络的结果。我们探究了在两种差异很大的语言(加泰罗尼亚语与韩语)中,就若干客观指标获得稳定行为的最小要求。我们还研究了针对未见过噪声的测试性能变异性,将其作为训练可用不同类型噪声数量的函数。结果表明,使用10分钟数据微调预训练的英文模型已可达到比其多两个数量级数据相当的性能。结果也展示了测试性能相对于训练噪声类型数量的相对稳定。

关键词

引用

@article{arxiv.1712.06340,
  title  = {Language and Noise Transfer in Speech Enhancement Generative Adversarial Network},
  author = {Santiago Pascual and Maruchan Park and Joan Serrà and Antonio Bonafonte and Kang-Hun Ahn},
  journal= {arXiv preprint arXiv:1712.06340},
  year   = {2017}
}