关于使用 DNN 自编码器实现鲁棒说话人识别
音频与语音处理
2018-11-08 v1 声音
摘要
本文中,我们分析了基于 DNN 的自编码器用于语音增强、去混响与去噪。目标应用是一个鲁棒说话人识别系统。我们首先用人工加噪与混响数据扩充 Fisher 数据库,并训练自编码器将带噪与混响语音映射至其干净版本。我们将该自编码器用作最先进的文本无关说话人识别系统的预处理步骤。我们比较了纯自编码器增强、多条件 PLDA 训练及其同时使用所取得的结果。我们给出了在 NIST SRE 2010、PRISM 以及人工损坏的 NIST SRE 2010 电话条件等多种条件下的详细分析。我们得出结论:所提出的预处理显著优于基线,且该技术可用于构建面向混响与噪声数据的鲁棒说话人识别系统。
引用
@article{arxiv.1811.02938,
title = {On the use of DNN Autoencoder for Robust Speaker Recognition},
author = {Ondrej Novotny and Oldrich Plchot and Pavel Matejka and Ondrej Glembek},
journal= {arXiv preprint arXiv:1811.02938},
year = {2018}
}
备注
5 pages, 1 figure