中文

基于扩散概率模型的面向指标语音增强

声音 2023-02-24 v1 计算与语言 音频与语音处理

摘要

基于深度神经网络的语音增强技术侧重于学习在配对训练数据监督下的含噪到干净的变换。然而,任务特定的评价指标(如 PESQ)通常是不可微的,无法直接构建于训练准则中。训练目标与评价指标之间的这种失配可能导致次优性能。为缓解该问题,我们提出一种面向指标的语音增强方法(MOSE),其利用扩散概率模型的最新进展,并将面向指标的训练策略整合到其反向过程中。具体而言,我们设计了一个基于 actor-critic 的框架,将评价指标视为后验奖励,从而引导反向过程朝向指标增大的方向。实验结果表明,MOSE 明显受益于面向指标的训练,并在所有评价指标上超越了生成式基线。

关键词

引用

@article{arxiv.2302.11989,
  title  = {Metric-oriented Speech Enhancement using Diffusion Probabilistic Model},
  author = {Chen Chen and Yuchen Hu and Weiwei Weng and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2302.11989},
  year   = {2023}
}

备注

Accepted by ICASSP2023