中文

时域语音表征对比学习中的数据增强

音频与语音处理 2020-07-03 v1 计算与语言 声音

摘要

基于利用过去片段预测语音未来片段的对比预测编码(Contrastive Predictive Coding, CPC)正作为一种强有力的语音信号表征学习算法而出现。然而,它在无监督评测基准上仍逊于其他方法。本文中,我们引入 WavAugment,一个时域数据增强库,并发现对过去部分施加增强通常比其他方法更高效且带来更好性能。我们发现音高修改、加性噪声与混响的组合显著提升了 CPC 的性能(相对提升 18-22%),以少 600 倍的数据击败了 Libri-light 参考结果。使用域外数据集,时域数据增强可将 CPC 推至与 Zero Speech Benchmark 2017 上的最优水平相当。我们还展示了时域数据增强在下游有限监督音素分类任务上一致地带来 12-15% 的相对提升。

关键词

引用

@article{arxiv.2007.00991,
  title  = {Data Augmenting Contrastive Learning of Speech Representations in the Time Domain},
  author = {Eugene Kharitonov and Morgane Rivière and Gabriel Synnaeve and Lior Wolf and Pierre-Emmanuel Mazaré and Matthijs Douze and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:2007.00991},
  year   = {2020}
}