中文

语音增强的由粗到精优化

声音 2019-08-23 v1 机器学习 音频与语音处理

摘要

本文针对语音增强任务提出了由粗到精的优化策略。余弦相似度损失[1]已被证明是衡量语音信号相似度的有效度量。然而,由于即使在高维空间中具有相同余弦相似度损失的增强语音也存在较大方差,使用该损失训练的深度神经网络可能无法预测出质量良好的增强语音。我们的由粗到精策略针对不同粒度优化余弦相似度损失,从而为从高维到相对低维的预测添加更多约束。通过这种方式,增强语音将更好地近似干净语音。实验结果表明,我们提出的由粗到精优化在判别模型和生成模型中均有效。此外,我们将由粗到精策略应用于生成对抗网络(GAN)中的对抗损失,并提出了动态感知损失,该损失从粗分辨率到精分辨率动态计算对抗损失。动态感知损失进一步提高了精度,与其他生成模型相比取得了当前最优结果。

关键词

引用

@article{arxiv.1908.08044,
  title  = {Coarse-to-fine Optimization for Speech Enhancement},
  author = {Jian Yao and Ahmad Al-Dahle},
  journal= {arXiv preprint arXiv:1908.08044},
  year   = {2019}
}