基于图聚类自监督度量学习的说话人日记化
音频与语音处理
2021-09-15 v1 声音
摘要
本文提出一种利用度量学习进行基于图的聚类的说话人日记化新算法。图聚类算法使用由相似度分数组成的邻接矩阵。这些分数由给定录音中成对音频段提取的说话人嵌入之间计算得到。本文提出一种利用自监督学习原理联合学习说话人嵌入与相似度度量的方法。该度量学习网络实现了概率线性判别分析(PLDA)的神经网络模型。自监督信号源自前一轮聚类所得的伪标签。表征学习与度量学习的整体模型以二元交叉熵损失进行训练。通过将基于自监督的度量学习与基于图的聚类算法相结合,我们在 AMI 与 DIHARD 数据集上分别相较 x-vector PLDA 凝聚层次聚类(AHC)方法取得了说话人日记化错误率(DER)上 60% 与 7% 的显著相对提升。
引用
@article{arxiv.2109.06824,
title = {Self-Supervised Metric Learning With Graph Clustering For Speaker Diarization},
author = {Prachi Singh and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2109.06824},
year = {2021}
}
备注
8 pages, Accepted in ASRU 2021