自监督深度说话人表征学习的迭代框架
音频与语音处理
2020-10-29 v1 声音
摘要
在本文中,我们提出了一种基于深度神经网络的迭代框架,用于自监督说话人表征学习。该框架首先通过对比损失最大化话语内不同片段之间的一致性,从而训练一个自监督说话人嵌入网络。利用DNN从带标签噪声的数据中学习的能力,我们提出对从前一个说话人网络获得的说话人嵌入进行聚类,并使用随后的类别分配作为伪标签来训练一个新的DNN。此外,我们利用前一步骤生成的伪标签迭代地训练说话人网络,以自举DNN的判别能力。在VoxCeleb数据集上进行了说话人验证实验。结果表明,我们提出的迭代自监督学习框架优于以往使用自监督的工作。经过5次迭代后的说话人网络,相较于使用对比损失训练的说话人嵌入模型,获得了61%的性能提升。
引用
@article{arxiv.2010.14751,
title = {An iterative framework for self-supervised deep speaker representation learning},
author = {Danwei Cai and Weiqing Wang and Ming Li},
journal= {arXiv preprint arXiv:2010.14751},
year = {2020}
}
备注
arXiv admin note: text overlap with arXiv:2010.12731