基于原型动量对比学习的自监督文本无关说话人验证
音频与语音处理
2021-02-16 v2 机器学习
摘要
在本研究中,我们探究用于说话人验证(SV)的自监督表示学习。首先,我们考察了一种结合动量对比(MoCo)学习框架的简单对比学习方法(SimCLR),其中MoCo说话人嵌入系统利用一个队列来维护大量负样本。我们表明,通过动量对比学习可以学到更好的说话人嵌入。接下来,我们探索了替代的增强策略,以归一化同一语音片段中两个随机分段的外在说话人变异性。具体而言,波形层面的增强大幅改善了SV任务的说话人表示。当引入原型记忆库时,所提出的MoCo说话人嵌入得到进一步提升,该记忆库通过中间聚类步骤鼓励说话人嵌入更接近其分配的原型。此外,我们将自监督框架推广到仅有一小部分数据被标注的半监督场景。在Voxceleb数据集上的综合实验表明,我们提出的自监督方法取得了与现有技术相媲美的性能,并且在使用部分标注数据时可接近全监督结果。
引用
@article{arxiv.2012.07178,
title = {Self-supervised Text-independent Speaker Verification using Prototypical Momentum Contrastive Learning},
author = {Wei Xia and Chunlei Zhang and Chao Weng and Meng Yu and Dong Yu},
journal= {arXiv preprint arXiv:2012.07178},
year = {2021}
}
备注
Accepted to ICASSP2021