中文

面向语音增强的目标特征感知对比拉伸

声音 2022-07-18 v4 计算与语言 音频与语音处理

摘要

由于使用深度学习模型作为基函数,语音增强(SE)性能已显著提升。本文中,我们提出一种感知对比拉伸(PCS)方法以进一步提升 SE 性能。PCS 基于临界频带重要性函数导出,并用于修改 SE 模型的目标。具体而言,基于感知重要性拉伸目标特征的对比度,从而改善整体 SE 性能。与基于后处理的实现相比,将 PCS 纳入训练阶段保持了性能并减少了在线计算。值得注意的是,PCS 可与不同的 SE 模型架构和训练准则结合。此外,PCS 不影响 SE 模型训练的因果性或收敛性。在 VoiceBank-DEMAND 数据集上的实验结果表明,所提方法可在因果(PESQ 分数 = 3.07)和非因果(PESQ 分数 = 3.35)SE 任务上均达到最先进性能。

关键词

引用

@article{arxiv.2203.17152,
  title  = {Perceptual Contrast Stretching on Target Feature for Speech Enhancement},
  author = {Rong Chao and Cheng Yu and Szu-Wei Fu and Xugang Lu and Yu Tsao},
  journal= {arXiv preprint arXiv:2203.17152},
  year   = {2022}
}

备注

Accepted by Interspeech 2022