中文

基于近邻对比学习的语音序列嵌入

人工智能 2023-10-24 v2

摘要

我们提出了一种简单的神经编码器架构,可使用无监督对比学习目标进行训练,其正样本来自数据增强的 k 近邻搜索。我们表明,当构建在近期自监督音频表征之上时,该方法可迭代应用,并在两项任务上产生具有竞争力的语音序列嵌入(SSE):随机语音序列的按例查询和口语词发现。在两项任务上,我们的方法在 5 种不同语言上大幅推动了当前最优水平。最后,我们在 LibriSpeech 数据集上建立了一个按例查询任务的基准,以监测该领域的未来进展。

关键词

引用

@article{arxiv.2204.05148,
  title  = {Speech Sequence Embeddings using Nearest Neighbors Contrastive Learning},
  author = {Robin Algayres and Adel Nabli and Benoit Sagot and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:2204.05148},
  year   = {2023}
}

备注

Interspeech 2022 New version on 10/21/23 with appendix data and gitlab link