中文

基于 VAE 的深度说话人嵌入正则化方法

声音 2019-04-09 v1 机器学习 音频与语音处理

摘要

深度说话人嵌入在说话人识别中取得了最先进的性能。这些嵌入向量(称为“x-vectors”)的一个潜在问题是其并非高斯分布,导致在使用著名的 PLDA 后端打分时出现性能下降。本文提出一种基于变分自编码器(VAE)的正则化方法。该模型将 x-vectors 变换到一个潜空间,其中映射后的潜码更具高斯性,从而更适用于 PLDA 打分。

关键词

引用

@article{arxiv.1904.03617,
  title  = {VAE-based regularization for deep speaker embedding},
  author = {Yang Zhang and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:1904.03617},
  year   = {2019}
}