中文

基于 p-邻域保留亲和矩阵的自调谐谱聚类用于说话人分割

信号处理 2025-06-06 v2 机器学习 声音 音频与语音处理

摘要

谱聚类在对说话人表示进行分组方面已证明有效,尽管在构建拉普拉斯算子之前处理亲和矩阵仍然困难,由于需要在构建拉普拉斯算子前进行精心的调谐。本研究提出了一种新颖的修剪算法,用于创建称为谱聚类在 p-邻域保留亲和矩阵 (SC-pNA) 的稀疏亲和矩阵。我们的方法通过允许可变数量的邻居来改进节点特定固定邻居选择,消除了需要外部调谐数据作为修剪参数的需求,这些参数直接从亲和矩阵中推导得出。SC-pNA 通过识别每一行初始亲和矩阵中的两个簇,并仅保留包含较大相似性的簇中最高的 p% 相似性得分。随后进行谱聚类,其簇数由最大特征间隙确定。在具有挑战性的 DIHARD-III 数据集上的实验结果突出了 SC-pNA 的优势,该方法也比现有自调谐方法更具计算效率。我们的实现可在 https://github.com/nikhilraghav29/SC-pNA 上获得。

关键词

引用

@article{arxiv.2410.00023,
  title  = {Self-Tuning Spectral Clustering for Speaker Diarization},
  author = {Nikhil Raghav and Avisek Gupta and Md Sahidullah and Swagatam Das},
  journal= {arXiv preprint arXiv:2410.00023},
  year   = {2025}
}

备注

This is the camera-ready version accepted for publication in the ICASSP 2025 proceedings