用于无监督音素分割的自监督对比学习
音频与语音处理
2020-08-07 v2 机器学习
声音
机器学习
摘要
我们提出了一种用于无监督音素边界检测任务的自监督表示学习模型。该模型为直接作用于原始波形的卷积神经网络。它利用噪声对比估计原理进行优化以识别信号中的频谱变化。在测试时,对模型输出应用峰值检测算法以产生最终边界。因此,所提模型以完全无监督的方式训练,无需以目标边界或音素转写形式给出的任何人工标注。我们使用 TIMIT 和 Buckeye 语料库将所提方法与若干无监督基线进行比较。结果表明我们的方法超越了基线模型,并在两个数据集上达到了最先进性能。此外,我们尝试用 Librispeech 语料库中的额外样本扩展训练集。我们在训练阶段未见过的分布和语言(英语、希伯来语和德语)上评估所得模型,并显示利用额外的无转写数据有益于模型性能。
引用
@article{arxiv.2007.13465,
title = {Self-Supervised Contrastive Learning for Unsupervised Phoneme Segmentation},
author = {Felix Kreuk and Joseph Keshet and Yossi Adi},
journal= {arXiv preprint arXiv:2007.13465},
year = {2020}
}
备注
Interspeech 2020 paper