基于对比均衡学习的无监督说话人识别表征学习
音频与语音处理
2020-10-23 v1 声音
摘要
在本文中,我们提出一种简单但强大的说话人识别无监督学习方法,即对比均衡学习(Contrastive Equilibrium Learning, CEL),其通过采用均匀性损失来增加嵌入中潜在 nuisance 因素的不确定性。同时,为保持说话人可分辨性,还配合使用对比相似性损失函数。实验结果表明,所提出的 CEL 显著优于最先进的(state-of-the-art)无监督说话人验证系统,最佳模型在 VoxCeleb1 和 VOiCES 评估集上分别取得 8.01% 和 4.01% 的 EER。此外,以经 CEL 预训练的初始化参数训练的有监督说话人嵌入网络,表现出优于随机初始化参数训练的网络性能。
引用
@article{arxiv.2010.11433,
title = {Unsupervised Representation Learning for Speaker Recognition via Contrastive Equilibrium Learning},
author = {Sung Hwan Mun and Woo Hyun Kang and Min Hyun Han and Nam Soo Kim},
journal= {arXiv preprint arXiv:2010.11433},
year = {2020}
}
备注
5 pages, 1 figure, 4 tables