利用相似性连接图与 GCN 增强自监督说话人验证
声音
2025-09-05 v1
摘要
随着语音识别技术的不断发展,说话人验证(SV)已成为身份认证的重要方法。传统 SV 方法依赖手工特征提取,而深度学习显著提升了系统性能。然而,标注数据的稀缺仍然限制了深度学习在 SV 中的广泛应用。自监督学习通过挖掘大规模无标注数据集中的潜在信息,增强模型泛化能力,是解决该问题的关键技术。DINO 是一种高效的自监督学习方法,通过聚类从无标注语音数据中生成伪标签,以支持后续训练。然而,聚类可能产生有噪声的伪标签,从而降低整体识别性能。为解决这一问题,本文提出了一种基于相似性连接图和图卷积网络的改进聚类框架。通过利用 GCN 对结构化数据建模的能力,并结合相似性连接图中节点间的关系信息,该框架优化了聚类过程,提高了伪标签的准确性,并增强了自监督说话人验证系统的鲁棒性和性能。实验结果表明,该方法显著提升了系统性能,为自监督说话人验证提供了一种新途径。
引用
@article{arxiv.2509.04147,
title = {Enhancing Self-Supervised Speaker Verification Using Similarity-Connected Graphs and GCN},
author = {Zhaorui Sun and Yihao Chen and Jialong Wang and Minqiang Xu and Lei Fang and Sian Fang and Lin Liu},
journal= {arXiv preprint arXiv:2509.04147},
year = {2025}
}