中文

噪声与混响环境下基于学习的语音增强系统泛化差距评估

音频与语音处理 2023-11-09 v2 机器学习 声音

摘要

噪声与混响语音混合的声学可变性受多种因素影响,如目标说话人与干扰噪声的谱时特性、信噪比(SNR)以及房间特性。这种巨大的可变性对基于学习的语音增强系统提出了重大挑战,因为训练与测试条件之间的不匹配会大幅降低系统性能。对未知条件的泛化通常通过在训练所用数据库之外的新语音、噪声或双耳房间脉冲响应(BRIR)数据库上测试系统来评估。然而,语音增强任务的难度在不同数据库间可能变化,这会显著影响结果。本研究引入了一种泛化评估框架,该框架使用在测试条件下训练的参考模型,使其可作为测试条件难度的代理。这得以将任务难度变化的影响与处理新数据的影响分离开来,从而定义一种称为泛化差距的泛化性能新度量。该程序以交叉验证方式通过循环多个语音、噪声和 BRIR 数据库来重复,以准确估计泛化差距。所提框架被应用于评估前馈神经网络(FFNN)、Conv-TasNet、DCCRN 和 MANNER 的泛化潜力。我们发现,对于所有模型,性能在语音不匹配时下降最多,而通过在多个数据库上训练可实现良好的噪声和房间泛化。此外,尽管近期模型在匹配条件下表现出更高性能,但其在不匹配条件下性能大幅下降,甚至可能劣于基于 FFNN 的系统。

关键词

引用

@article{arxiv.2309.06183,
  title  = {Assessing the Generalization Gap of Learning-Based Speech Enhancement Systems in Noisy and Reverberant Environments},
  author = {Philippe Gonzalez and Tommy Sonne Alstrøm and Tobias May},
  journal= {arXiv preprint arXiv:2309.06183},
  year   = {2023}
}

备注

Accepted to IEEE/ACM TASLP