中文

一种基于离散 Tied 变分自编码器的鲁棒说话人聚类方法

音频与语音处理 2020-03-05 v1 机器学习 声音

摘要

近年来,基于聚合层次聚类(AHC)的说话人聚类模型是解决两类主要问题(无预设类别数聚类和固定类别数聚类)的常用方法。通常,模型以 i-vectors 等特征作为概率输入,概率线性判别分析模型(PLDA)旨在长语音应用场景中形成距离矩阵,随后通过聚类模型获得聚类结果。然而,传统的基于 AHC 的说话人聚类方法存在运行时间长的缺点,且对环境噪声仍较敏感。本文在 Tied 变分自编码器(TVAE)的启发下,提出一种基于互信息(MI)和带离散变量的非线性模型的新颖说话人聚类方法,以增强抗噪鲁棒性。所提方法称为离散 Tied 变分自编码器(DTVAE),大幅缩短了耗时。实验结果表明,该方法优于通用模型,取得了相对准确率(ACC)的提升和显著的时间缩减。

关键词

引用

@article{arxiv.2003.01955,
  title  = {A Robust Speaker Clustering Method Based on Discrete Tied Variational Autoencoder},
  author = {Chen Feng and Jianzong Wang and Tongxu Li and Junqing Peng and Jing Xiao},
  journal= {arXiv preprint arXiv:2003.01955},
  year   = {2020}
}

备注

will be presented in ICASSP 2020