MK-SGC-SC:无监督说话人日志中谱聚类的多核引导稀疏图构建
音频与语音处理
2026-01-30 v2 机器学习
声音
摘要
说话人日志旨在将音频记录分割成对应于各个说话人的区域。尽管无监督说话人日志本身具有挑战性,但在没有预训练或弱监督的情况下识别说话人区域的前景激励了对聚类技术的研究。在这项工作中,我们分享了一个显著发现:以原则性方式测量说话人嵌入的多核相似性,进而为谱聚类构建稀疏图,足以在完全无监督的设置下达到最先进的性能。具体来说,我们考虑了四个多项式核和一个一次反余弦核来测量说话人嵌入的相似性,并以此原则性地构建稀疏图以强调局部相似性。实验表明,所提出的方法在DIHARD-III、AMI和VoxConverse语料库的各种具有挑战性的环境中,在无监督说话人日志方面表现出色。为鼓励进一步研究,我们的实现可在https://github.com/nikhilraghav29/MK-SGC-SC获取。
引用
@article{arxiv.2601.19946,
title = {MK-SGC-SC: Multiple Kernel Guided Sparse Graph Construction in Spectral Clustering for Unsupervised Speaker Diarization},
author = {Nikhil Raghav and Avisek Gupta and Swagatam Das and Md Sahidullah},
journal= {arXiv preprint arXiv:2601.19946},
year = {2026}
}
备注
5 pages