用于说话人日志的端到端监督层次图聚类
音频与语音处理
2024-12-03 v2 人工智能
声音
摘要
说话人日志,即根据说话人身份对音频录音进行分段的任务,是多个下游应用的重要语音预处理步骤。传统的日志方法涉及嵌入提取和聚类的多个步骤,这些步骤通常是孤立优化的。虽然端到端日志系统试图为任务学习单一模型,但它们通常训练繁琐且需要大量监督数据集。在本文中,我们提出了一种基于图神经网络(GNN)的端到端监督层次聚类算法,称为端到端监督层次聚类(E-SHARC)。嵌入提取器使用预训练的x-vector模型初始化,而GNN模型最初使用来自预训练模型的x-vector嵌入进行训练。最后,E-SHARC模型使用前端梅尔滤波器组特征作为输入,并联合优化嵌入提取器和GNN聚类模块,通过端到端优化执行表示学习、度量学习和聚类。此外,利用来自外部重叠检测器的额外输入,E-SHARC方法能够预测重叠语音区域中的说话人。在AMI、Voxconverse和DISPLACE等基准数据集上的实验评估表明,所提出的E-SHARC框架使用基于图的聚类方法提供了有竞争力的日志结果。
引用
@article{arxiv.2401.12850,
title = {End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization},
author = {Prachi Singh and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2401.12850},
year = {2024}
}
备注
11 pages. Under review IEEE TASLP. \c{opyright} 2024 IEEE