基于图神经网络的监督层次聚类用于说话人日志
声音
2023-02-27 v1 机器学习
音频与语音处理
摘要
传统的说话人日志方法将音频文件分窗为短段以提取说话人嵌入,随后对嵌入进行无监督聚类。这一多步骤方法为每个段生成说话人分配。在本文中,我们提出了一种新颖的用于说话人日志的监督层次图聚类算法(SHARC),其中我们引入使用图神经网络(GNN)的层次结构来执行监督聚类。该监督使模型能够更新表征并直接改善聚类性能,从而实现单步日志方法。在所提工作中,输入段嵌入被视为图的节点,边权重对应于节点间的相似度分数。我们还提出了一种联合更新嵌入提取器和GNN模型以执行端到端说话人日志(E2E-SHARC)的方法。在推理期间,使用节点密度和边存在概率执行层次聚类以合并段直至收敛。在日志实验中,我们表明所提E2E-SHARC方法在AMI和Voxconverse等基准数据集上分别比基线系统实现了53%和44%的相对提升。
引用
@article{arxiv.2302.12716,
title = {Supervised Hierarchical Clustering using Graph Neural Networks for Speaker Diarization},
author = {Prachi Singh and Amrit Kaul and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2302.12716},
year = {2023}
}
备注
5 pages including references. Accepted in ICASSP 2023