通过维数正则化和得分归一化推进自蒸馏原型网络的前沿
音频与语音处理
2025-05-21 v1 声音
摘要
开发无说话人标签的说话人验证(SV)系统一直是长期以来的挑战。早期研究指出,自监督方法与完全监督方法之间存在显著的性能差距。本文通过引入维数正则化来增强非对比自监督框架——自蒸馏原型网络(SDPN),该正则化通过对说话人嵌入应用正则化项来显式地解决崩溃问题。此外,我们将来自完全监督SV的得分归一化技术集成进来,以进一步弥合与监督验证性能之间的差距。加入维数正则化和得分归一化的SDPN在VoxCeleb1说话人验证评估基准上实现了新的状态最佳成绩,分别对于VoxCeleb1-{O,E,H}试验达到1.29%、1.60%和2.80%的等错误率。这些结果显示,相对于当前最佳自监督方法,分别实现了28.3%、19.6%和22.6%的相对改进,从而推动了SV技术的前沿发展。
引用
@article{arxiv.2505.13826,
title = {Pushing the Frontiers of Self-Distillation Prototypes Network with Dimension Regularization and Score Normalization},
author = {Yafeng Chen and Chong Deng and Hui Wang and Yiheng Jiang and Han Yin and Qian Chen and Wen Wang},
journal= {arXiv preprint arXiv:2505.13826},
year = {2025}
}