中文

通过细粒度语音特征改进语音增强

声音 2022-07-12 v2 机器学习 音频与语音处理

摘要

尽管基于深度学习的语音增强系统已在提升语音信号质量方面取得快速进展,但其输出仍可能产生伪影且听感不自然。我们提出一种新颖的语音增强方法,旨在通过优化语音的关键特征来改善增强信号的感知质量与自然度。我们首先确定已被发现与嗓音质量良好相关的关键声学参数(例如 jitter、shimmer 和 spectral flux),然后提出目标函数,旨在减小干净语音与增强语音在这些特征上的差异。完整的声学特征集合为扩展日内瓦声学参数集(eGeMAPS),包含 25 个与语音感知相关的不同属性。鉴于这些特征计算的非可微性,我们首先构建 eGeMAPS 的可微估计器,然后利用它们对现有语音增强系统进行微调。我们的方法具有通用性,可应用于任何现有的基于深度学习的增强系统以进一步改善增强语音信号。在深度噪声抑制(DNS)挑战数据集上进行的实验结果表明,我们的方法能够改进最先进的基于深度学习的增强系统。

关键词

引用

@article{arxiv.2207.00237,
  title  = {Improving Speech Enhancement through Fine-Grained Speech Characteristics},
  author = {Muqiao Yang and Joseph Konan and David Bick and Anurag Kumar and Shinji Watanabe and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2207.00237},
  year   = {2022}
}

备注

Accepted at InterSpeech 2022