基于条件生成对抗网络的短语音说话人验证 i-vector 变换
音频与语音处理
2018-04-03 v1 机器学习
声音
摘要
基于 i-vector 的文本无关说话人验证(SV)系统在处理短语音时性能往往较差,因为短语音中偏倚的音素分布使得提取的 i-vector 不可靠。本文提出一种使用生成对抗网络(GAN)的 i-vector 补偿方法,其生成器网络训练为从短语音 i-vector 生成补偿后的 i-vector,而判别器网络训练为判断一个 i-vector 是由生成器生成还是从长语音提取。此外,我们为 GAN 分配另外两个学习任务以稳定其训练并使生成的 i-vector 更具说话人特异性。在 NIST SRE 2008 “10sec-10sec” 条件下的说话人验证实验表明,我们的方法相较传统 i-vector 与 PLDA 系统将等错误率降低了 11.3%。
引用
@article{arxiv.1804.00290,
title = {I-vector Transformation Using Conditional Generative Adversarial Networks for Short Utterance Speaker Verification},
author = {Jiacen Zhang and Nakamasa Inoue and Koichi Shinoda},
journal= {arXiv preprint arXiv:1804.00290},
year = {2018}
}