中文

自蒸馏原型网络:无监督学习鲁棒说话人表征

音频与语音处理 2024-12-28 v2 声音

摘要

训练能够从不使用显式说话人标签的情况下获得判别性和鲁棒的说话人验证系统仍是持久的挑战。本文提出了一种新的自监督说话人验证方法——自蒸馏原型网络(SDPN),有效促进了自监督说话人表征的学习。SDPN将增强视图的表示分配给与原始视图相同的原型,从而实现视图之间的有效知识传递。原初地由于缺乏负样本,SDPN训练过程中,网络倾向于在嵌入空间中将正样本对对齐得非常紧密,导致模型塌陷。为缓解此问题,我们在SDPN的嵌入中引入了多样性正则化项。针对VoxCeleb数据集进行的全面实验表明,SDPN在自监督说话人验证方面具有优越性。SDPN在VoxCeleb1说话人验证评估基准上实现了新的状态,分别在VoxCeleb1-O、VoxCeleb1-E和VoxCeleb1-H试验中分别达到了1.80%、1.99%和3.62%的等效错误率(EER),且在训练期间未使用任何说话人标签。

关键词

引用

@article{arxiv.2406.11169,
  title  = {Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision},
  author = {Yafeng Chen and Siqi Zheng and Hui Wang and Luyao Cheng and Qian Chen and Shiliang Zhang and Wen Wang},
  journal= {arXiv preprint arXiv:2406.11169},
  year   = {2024}
}

备注

We update this paper to an earlier paper arXiv:2308.02774