面向鲁棒说话人识别的 DNN 语音信号增强分析
音频与语音处理
2018-11-20 v1 声音
摘要
本文中,我们针对用于语音增强、去混响与去噪的基于 DNN 的自编码器进行分析。目标应用是一个鲁棒说话人验证(SV)系统。我们的方法始于精心设计并覆盖广泛声学条件的数据增强过程,并为 SV 系统各组件获取丰富训练数据。我们用人工加噪与混响数据增强若干个 SV 中常用的知名数据库,并用它们训练一个去噪自编码器(将带噪与混响语音映射至其干净版本)以及目前被视为 SV 中最先进技术的 x-vector 提取器。随后,我们将该自编码器用作文本无关 SV 系统的预处理步骤。我们比较了自编码器增强、多条件 PLDA 训练及其联合使用所取得的结果。我们给出了在 NIST SRE 2010、2016、PRISM 各种条件及重传数据下的详细分析。我们得出结论:所提预处理可显著改善 i-vector 与 x-vector 基线,且该技可被用于为各种目标域构建鲁棒 SV 系统。
引用
@article{arxiv.1811.07629,
title = {Analysis of DNN Speech Signal Enhancement for Robust Speaker Recognition},
author = {Ondrej Novotny and Oldrich Plchot and Ondrej Glembek and Jan "Honza" Cernocky and Lukas Burget},
journal= {arXiv preprint arXiv:1811.07629},
year = {2018}
}
备注
16 pages, 7 figures, Submission to Computer Speech and Language, special issue on Speaker and language characterization and recognition