基于主导集的说话人聚类
声音
2018-05-23 v1 音频与语音处理
摘要
说话人聚类是基于一组语音片段形成说话人特定分组的任务。在本文中,我们通过使用主导集(DS)来解决该任务。DS是一种基于图的聚类算法,具有契合我们问题的有趣性质,且此前从未应用于说话人聚类。我们报告了在TIMIT数据集上针对标准聚类技术和特定说话人聚类方法的全面实验。此外,我们通过使用直接在TIMIT上经深度神经网络学习的特征以及从预训练的VGGVox网络提取的特征,比较了不同特征下的性能。为评估稳定性,我们对方法的自由参数进行了敏感性分析,表明性能在参数变化下是稳定的。所进行的广泛实验证实了所提方法的有效性,在三种不同标准度量下报告了最先进(state-of-the-art)的结果。我们还首次报告了在整个TIMIT数据集上说话人聚类的参考基线结果。
引用
@article{arxiv.1805.08641,
title = {Speaker Clustering Using Dominant Sets},
author = {Feliks Hibraj and Sebastiano Vascon and Thilo Stadelmann and Marcello Pelillo},
journal= {arXiv preprint arXiv:1805.08641},
year = {2018}
}
备注
ICPR 2018