中文

基于 VAE 的说话人验证域自适应方法

音频与语音处理 2019-08-28 v1 机器学习 声音

摘要

深度说话人嵌入在说话人验证中已取得令人满意的性能。通过强制神经模型区分训练集中的说话人,可从隐藏层得到深度说话人嵌入(称为“x-vectors”)。尽管性能良好,当前的嵌入模型对域高度敏感,这意味着它通常在声学条件与训练数据匹配(域内)的域中表现良好,而在失配域(域外)中性能下降。在本文中,我们提出一种基于变分自编码器(VAE)的域自适应方法。该模型将 x-vectors 变换到一个正则化潜空间;在此潜空间内,来自目标域的少量数据即足以完成自适应。我们的实验表明,通过这种 VAE 自适应方法,说话人嵌入可轻松变换至目标域,带来显著的性能提升。

关键词

引用

@article{arxiv.1908.10092,
  title  = {VAE-based Domain Adaptation for Speaker Verification},
  author = {Xueyi Wang and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:1908.10092},
  year   = {2019}
}