基于 p-邻域保留亲和矩阵的自调谐谱聚类用于说话人分割
信号处理
2025-06-06 v2 机器学习
声音
音频与语音处理
摘要
谱聚类在对说话人表示进行分组方面已证明有效,尽管在构建拉普拉斯算子之前处理亲和矩阵仍然困难,由于需要在构建拉普拉斯算子前进行精心的调谐。本研究提出了一种新颖的修剪算法,用于创建称为谱聚类在 p-邻域保留亲和矩阵 (SC-pNA) 的稀疏亲和矩阵。我们的方法通过允许可变数量的邻居来改进节点特定固定邻居选择,消除了需要外部调谐数据作为修剪参数的需求,这些参数直接从亲和矩阵中推导得出。SC-pNA 通过识别每一行初始亲和矩阵中的两个簇,并仅保留包含较大相似性的簇中最高的 p% 相似性得分。随后进行谱聚类,其簇数由最大特征间隙确定。在具有挑战性的 DIHARD-III 数据集上的实验结果突出了 SC-pNA 的优势,该方法也比现有自调谐方法更具计算效率。我们的实现可在 https://github.com/nikhilraghav29/SC-pNA 上获得。
引用
@article{arxiv.2410.00023,
title = {Self-Tuning Spectral Clustering for Speaker Diarization},
author = {Nikhil Raghav and Avisek Gupta and Md Sahidullah and Swagatam Das},
journal= {arXiv preprint arXiv:2410.00023},
year = {2025}
}
备注
This is the camera-ready version accepted for publication in the ICASSP 2025 proceedings