中文

语句级语音表示的非对比自监督学习

音频与语音处理 2022-08-11 v1 机器学习

摘要

考虑到未标注语音数据的丰富性以及标注的高成本,无监督学习方法对于更好的系统开发至关重要。最成功的方法之一是对比自监督方法,其需要负采样:对替代样本进行采样以与当前样本(锚点)进行对比。然而,在没有标签的情况下,很难确保所有负样本都属于不同于锚点类别的类别。本文在未标注语音语料库上应用非对比自监督学习方法来学习语句级嵌入。我们使用了计算机视觉中提出的无标签蒸馏(DINO),并将其适配到语音领域。与对比方法不同,DINO 不需要负采样。这些嵌入在说话人验证和情感识别上进行了评估。在说话人验证中,采用余弦打分的无监督 DINO 嵌入在 VoxCeleb1 测试集上提供了 4.38% 的 EER,相对于最佳对比自监督方法在 EER 上提升了 40%。一种不需要说话人标签的迭代伪标签训练流程进一步将 EER 提升至 1.89%。在情感识别中,DINO 嵌入在 IEMOCAP、Crema-D 和 MSP-Podcast 上的 micro-f1 分数分别为 60.87%、79.21% 和 56.98%。结果表明了 DINO 嵌入对不同语音应用的通用性。

关键词

引用

@article{arxiv.2208.05413,
  title  = {Non-Contrastive Self-Supervised Learning of Utterance-Level Speech Representations},
  author = {Jaejin Cho and Raghavendra Pappagari and Piotr Żelasko and Laureano Moro-Velazquez and Jesús Villalba and Najim Dehak},
  journal= {arXiv preprint arXiv:2208.05413},
  year   = {2022}
}

备注

Accepted at Interspeech 2022