基于动量对比学习说话人嵌入
计算与语言
2020-09-08 v2 机器学习
音频与语音处理
摘要
说话人验证可表述为表征学习任务,即从变长语音中提取具有说话人判别性的嵌入。动量对比(MoCo)是近期提出的无监督表征学习框架,并已证明对学习下游视觉任务的良好特征表示有效。本工作中,我们应用 MoCo 从语音段中学习说话人嵌入。我们探索了 MoCo 在无监督学习与预训练设置下的应用。在无监督场景中,嵌入由 MoCo 在不使用任何说话人特定信息的情况下从音频数据学习。在一个含 名说话人的大规模数据集上,MoCo 无监督训练可达到等错误率(EER),若使用额外无标签数据,EER 可进一步降至 。在预训练场景中,由 MoCo 训练的编码器用于初始化下游有监督训练。在 MoCo 训练模型上微调后,等错误率(EER)相对降低 (从 降至 ),优于精心调参的从头基线训练。对比研究证实了 MoCo 学习良好说话人嵌入的有效性。
引用
@article{arxiv.2001.01986,
title = {Learning Speaker Embedding with Momentum Contrast},
author = {Ke Ding and Xuanji He and Guanglu Wan},
journal= {arXiv preprint arXiv:2001.01986},
year = {2020}
}