基于两遍留一高斯 PLDA 聚类 DNN 嵌入的说话人日记化
音频与语音处理
2021-06-16 v3 机器学习
信号处理
摘要
许多现代说话人日记化系统,如近期开发的 VBx 方法,依赖于 DNN 说话人嵌入的聚类随后重分段。该方法的两个问题是:DNN 并未直接针对此任务优化,且参数针对不同应用需要大量重调。我们近期在此方向上取得进展,提出了留一高斯 PLDA (LGP) 聚类算法,以及一种训练 DNN 使嵌入直接优化该打分方法性能的思路。本文提出该系统的新两遍版本,其中第二遍使用更细的时间分辨率以显著提升整体性能。在 Callhome 语料库上,我们实现了首个无需任何任务相关参数调优即低于 4% 的已发布错误率。我们还展示了朝多个日记化任务的鲁棒单一解所取得的显著进展。
引用
@article{arxiv.2104.02469,
title = {Speaker Diarization using Two-pass Leave-One-Out Gaussian PLDA Clustering of DNN Embeddings},
author = {Kiran Karra and Alan McCree},
journal= {arXiv preprint arXiv:2104.02469},
year = {2021}
}
备注
5 pages, 2 figures, accepted at INTERSPEECH 2021