中文

使用多模态多样化正样本对进行说话人编码器的自监督训练

音频与语音处理 2022-10-28 v1 声音 信号处理

摘要

我们研究了一种新颖的神经网络架构及其训练策略,用于在没有任何身份标签的情况下进行说话人识别的说话人编码器。该说话人编码器被训练用于从不同长度的语音片段中提取固定大小的说话人嵌入。对比学习是一种典型的自监督学习技术。然而,说话人编码器的质量在很大程度上取决于正负样本对的采样策略。通常,我们会从同一段语音中采样一对正样本片段。不幸的是,这种简陋的正样本对 (poor-man's positive pairs, PPP) 缺乏训练鲁棒编码器所需的多样性。在这项工作中,我们提出了一种具有新颖采样策略的多模态对比学习技术。通过交叉引用语音和人脸数据,我们研究了一种为对比学习寻找多样化正样本对 (diverse positive pairs, DPP) 的方法,从而提高了说话人编码器的鲁棒性。我们在没有任何说话人标签的 VoxCeleb2 数据集上训练说话人编码器,在 VoxCeleb1 的三个测试集上,使用所提出的渐进式聚类策略,实现了 2.89%、3.17% 和 6.27% 的等错误率 (EER);使用带有伪标签的两阶段学习策略,实现了 1.44%、1.77% 和 3.27% 的 EER。这种新颖的解决方案以较大优势超越了最先进的自监督学习方法,同时取得了与有监督学习方法相当的结果。我们还在说话人信息未知的 LRS2 和 LRW 数据集上评估了我们的自监督学习技术。所有实验都表明,所提出的神经网络架构和采样策略在不同数据集上具有鲁棒性。

关键词

引用

@article{arxiv.2210.15385,
  title  = {Self-Supervised Training of Speaker Encoder with Multi-Modal Diverse Positive Pairs},
  author = {Ruijie Tao and Kong Aik Lee and Rohan Kumar Das and Ville Hautamäki and Haizhou Li},
  journal= {arXiv preprint arXiv:2210.15385},
  year   = {2022}
}

备注

13 pages