用于噪声鲁棒说话人确认的对抗网络瓶颈特征
声音
2017-06-13 v1
摘要
在本文中,我们提出了一种由对抗网络(AN)生成的噪声鲁棒瓶颈特征表示。该AN包含两个级联连接的网络:编码网络(EN)和判别网络(DN)。纯净语音和含噪语音的Mel频率倒谱系数(MFCCs)被用作EN的输入,EN的输出被用作噪声鲁棒特征。EN和DN交替训练,即在训练DN时,选择噪声类型作为训练标签;而在训练EN时,所有标签被设置为相同,即纯净语音标签,其目的是使AN特征对噪声不变,从而实现噪声鲁棒性。我们在基于高斯混合模型-通用背景模型的说话人确认系统上评估了所提出特征的性能,并与短时谱幅度最小均方误差(STSA-MMSE)和基于深度神经网络的语音增强(DNN-SE)方法增强的语音MFCC特征进行了比较。在RSR2015数据库上的实验结果表明,对于不同的噪声类型和信噪比,所提出的AN瓶颈特征(AN-BN)显著优于基于STSA-MMSE和DNN-SE的MFCCs。此外,AN-BN特征能够在纯净条件下提升说话人确认的性能。
引用
@article{arxiv.1706.03397,
title = {Adversarial Network Bottleneck Features for Noise Robust Speaker Verification},
author = {Hong Yu and Zheng-Hua Tan and Zhanyu Ma and Jun Guo},
journal= {arXiv preprint arXiv:1706.03397},
year = {2017}
}