一种基于离散 Tied 变分自编码器的鲁棒说话人聚类方法
音频与语音处理
2020-03-05 v1 机器学习
声音
摘要
近年来,基于聚合层次聚类(AHC)的说话人聚类模型是解决两类主要问题(无预设类别数聚类和固定类别数聚类)的常用方法。通常,模型以 i-vectors 等特征作为概率输入,概率线性判别分析模型(PLDA)旨在长语音应用场景中形成距离矩阵,随后通过聚类模型获得聚类结果。然而,传统的基于 AHC 的说话人聚类方法存在运行时间长的缺点,且对环境噪声仍较敏感。本文在 Tied 变分自编码器(TVAE)的启发下,提出一种基于互信息(MI)和带离散变量的非线性模型的新颖说话人聚类方法,以增强抗噪鲁棒性。所提方法称为离散 Tied 变分自编码器(DTVAE),大幅缩短了耗时。实验结果表明,该方法优于通用模型,取得了相对准确率(ACC)的提升和显著的时间缩减。
引用
@article{arxiv.2003.01955,
title = {A Robust Speaker Clustering Method Based on Discrete Tied Variational Autoencoder},
author = {Chen Feng and Jianzong Wang and Tongxu Li and Junqing Peng and Jing Xiao},
journal= {arXiv preprint arXiv:2003.01955},
year = {2020}
}
备注
will be presented in ICASSP 2020