动量对比说话人表征学习
音频与语音处理
2020-10-23 v1 声音
摘要
无监督表征学习通过缩小与有监督特征学习的性能差距已展现出显著成就,尤其在图像领域。在本研究中,为将无监督学习技术扩展至语音领域,我们提出以学习机制形式实现的面向 VoxCeleb 的动量对比(MoCoVox)。我们在 VoxCeleb1 上通过实例判别预训练 MoCoVox。将 MoCoVox 应用于说话人验证表明,其以较大优势优于最先进的基于度量学习的方法。我们还通过分析所学表征的分布,从经验上展示了语音领域中对比学习的特征。此外,我们探究了何种预训练任务适于说话人验证。我们期望在无人类监督下学习说话人表征有助于解决开集说话人识别问题。
引用
@article{arxiv.2010.11457,
title = {Momentum Contrast Speaker Representation Learning},
author = {Jangho Lee and Jaihyun Koh and Sungroh Yoon},
journal= {arXiv preprint arXiv:2010.11457},
year = {2020}
}