中文

C3-DINO:面向说话人验证的对比与非对比自监督联合学习

音频与语音处理 2022-11-23 v1 声音

摘要

自监督学习(SSL)在语音处理领域受到越来越多的关注。近期研究表明,对比学习能够以自监督方式学习具有判别性的说话人嵌入。然而,基础对比自监督学习(CSSL)假设由锚样本的一个视图与其他任意样本的视图所构成的配对均为负对,这在构建损失函数时引入了诸多假负对。该问题被称为classclass-collisioncollision(类别碰撞),仍是阻碍基于CSSL的说话人验证(SV)系统取得更优性能的主要问题。同时,研究显示无负样本SSL框架在说话人或图像表示学习中表现良好。本研究探究可提升SV性能的SSL技术。我们首先分析CSSL系统中假负对的影响。随后,提出一种多阶段类别碰撞校正(C3)方法,其带来了最先进的基于CSSL的说话人嵌入系统。在预训练CSSL模型基础上,我们进一步提出采用无负样本SSL目标(即DINO)微调说话人嵌入网络。所得说话人嵌入系统(C3-DINO)在Voxceleb1测试集上通过简单余弦距离打分方法取得2.5% EER,相较先前SOTA SSL系统(4.86%)取得显著的+45%相对提升。通过对Voxceleb2训练集进行说话人聚类与伪标注,将LDA/CDS后端应用于C3-DINO说话人嵌入可进一步将EER降至2.2%。对Voxceleb基准与内部数据集的全面实验研究证明了所提方法的有效性,且SSL SV与有监督对应方法间的性能差距进一步缩小。

关键词

引用

@article{arxiv.2208.07446,
  title  = {C3-DINO: Joint Contrastive and Non-contrastive Self-Supervised Learning for Speaker Verification},
  author = {Chunlei Zhang and Dong Yu},
  journal= {arXiv preprint arXiv:2208.07446},
  year   = {2022}
}

备注

Accepted to IEEE Journal of Selected Topics in Signal Processing