基于近邻对比学习的语音序列嵌入
人工智能
2023-10-24 v2
摘要
我们提出了一种简单的神经编码器架构,可使用无监督对比学习目标进行训练,其正样本来自数据增强的 k 近邻搜索。我们表明,当构建在近期自监督音频表征之上时,该方法可迭代应用,并在两项任务上产生具有竞争力的语音序列嵌入(SSE):随机语音序列的按例查询和口语词发现。在两项任务上,我们的方法在 5 种不同语言上大幅推动了当前最优水平。最后,我们在 LibriSpeech 数据集上建立了一个按例查询任务的基准,以监测该领域的未来进展。
引用
@article{arxiv.2204.05148,
title = {Speech Sequence Embeddings using Nearest Neighbors Contrastive Learning},
author = {Robin Algayres and Adel Nabli and Benoit Sagot and Emmanuel Dupoux},
journal= {arXiv preprint arXiv:2204.05148},
year = {2023}
}
备注
Interspeech 2022 New version on 10/21/23 with appendix data and gitlab link