基于 VAE 的说话人验证域自适应方法
音频与语音处理
2019-08-28 v1 机器学习
声音
摘要
深度说话人嵌入在说话人验证中已取得令人满意的性能。通过强制神经模型区分训练集中的说话人,可从隐藏层得到深度说话人嵌入(称为“x-vectors”)。尽管性能良好,当前的嵌入模型对域高度敏感,这意味着它通常在声学条件与训练数据匹配(域内)的域中表现良好,而在失配域(域外)中性能下降。在本文中,我们提出一种基于变分自编码器(VAE)的域自适应方法。该模型将 x-vectors 变换到一个正则化潜空间;在此潜空间内,来自目标域的少量数据即足以完成自适应。我们的实验表明,通过这种 VAE 自适应方法,说话人嵌入可轻松变换至目标域,带来显著的性能提升。
引用
@article{arxiv.1908.10092,
title = {VAE-based Domain Adaptation for Speaker Verification},
author = {Xueyi Wang and Lantian Li and Dong Wang},
journal= {arXiv preprint arXiv:1908.10092},
year = {2019}
}