利用正则化蒸馏框架推进自监督说话人验证的极限
音频与语音处理
2023-08-04 v4 声音
摘要
在无说话人标签的情况下训练鲁棒的说话人验证系统长期以来是一项具有挑战性的任务。以往研究观察到自监督方法与全监督方法之间存在较大的性能差距。本文中,我们应用一种称为无标签蒸馏(DINO)的非对比自监督学习框架,并提出应用于DINO中嵌入向量的两项正则化项。一项正则化项保证嵌入向量的多样性,另一项正则化项对各个嵌入向量的变量去相关。我们探讨了在时域和频域上多种数据增强技术的有效性。在VoxCeleb数据集上进行的一系列实验证明了正则化DINO框架在说话人验证中的优越性。我们的方法在VoxCeleb上以单阶段自监督设定取得了最先进的说话人验证性能。代码已公开于https://github.com/alibaba-damo-academy/3D-Speaker。
引用
@article{arxiv.2211.04168,
title = {Pushing the limits of self-supervised speaker verification using regularized distillation framework},
author = {Yafeng Chen and Siqi Zheng and Hui Wang and Luyao Cheng and Qian Chen},
journal= {arXiv preprint arXiv:2211.04168},
year = {2023}
}