中文

基于频域自回归建模的语音增强

音频与语音处理 2023-09-26 v1 人工智能 声音

摘要

远场真实场景中的语音应用常需处理被混响污染的信号。去混响任务对于提升听感质量以及降低自动语音识别(ASR)等应用中的错误率而言是重要的一步。我们提出了一种统一的语音去混响框架,利用自回归(AR)模型提供的包络-载波分解方法来改善语音质量与 ASR 性能。AR 模型应用于子带语音信号的频域以分离包络与载波部分。提出了一种基于双路径长短期记忆(DPLSTM)模型的新型神经架构,联合增强子带包络与载波分量。去混响后的包络-载波信号被调制,子带信号被合成以重建音频信号。用于包络与载波分量去混响的 DPLSTM 模型也允许对下游 ASR 任务的网络权重进行联合学习。在 REVERB 挑战数据集以及 VOiCES 数据集上的 ASR 任务中,我们表明语音去混响网络与 E2E ASR 模型的联合学习相比基于 log-mel 谱图训练的基线 ASR 系统以及其他去混响基准取得了显著性能提升(相对基线系统平均相对提升 10-24%)。通过主观听测评估的语音质量改善进一步凸显了重建音频质量的提升。

关键词

引用

@article{arxiv.2309.13537,
  title  = {Speech enhancement with frequency domain auto-regressive modeling},
  author = {Anurenjan Purushothaman and Debottam Dutta and Rohit Kumar and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2309.13537},
  year   = {2023}
}

备注

10 pages