中文

基于动量对比学习说话人嵌入

计算与语言 2020-09-08 v2 机器学习 音频与语音处理

摘要

说话人验证可表述为表征学习任务,即从变长语音中提取具有说话人判别性的嵌入。动量对比(MoCo)是近期提出的无监督表征学习框架,并已证明对学习下游视觉任务的良好特征表示有效。本工作中,我们应用 MoCo 从语音段中学习说话人嵌入。我们探索了 MoCo 在无监督学习与预训练设置下的应用。在无监督场景中,嵌入由 MoCo 在不使用任何说话人特定信息的情况下从音频数据学习。在一个含 2,5002,500 名说话人的大规模数据集上,MoCo 无监督训练可达到等错误率(EER)4.275%4.275\%,若使用额外无标签数据,EER 可进一步降至 3.58%3.58\%。在预训练场景中,由 MoCo 训练的编码器用于初始化下游有监督训练。在 MoCo 训练模型上微调后,等错误率(EER)相对降低 13.7%13.7\%(从 1.44%1.44\% 降至 1.242%1.242\%),优于精心调参的从头基线训练。对比研究证实了 MoCo 学习良好说话人嵌入的有效性。

关键词

引用

@article{arxiv.2001.01986,
  title  = {Learning Speaker Embedding with Momentum Contrast},
  author = {Ke Ding and Xuanji He and Guanglu Wan},
  journal= {arXiv preprint arXiv:2001.01986},
  year   = {2020}
}