中文

vq-wav2vec:通过自监督学习获取离散语音表示

计算与语言 2020-02-18 v3 机器学习

摘要

我们提出 vq-wav2vec,通过 wav2vec 风格的自监督上下文预测任务来学习音频片段的离散表示。该算法使用 gumbel softmax 或在线 k-means 聚类对稠密表示进行量化。离散化使得可直接应用来自 NLP 领域、需要离散输入的算法。实验表明,BERT 预训练在 TIMIT 音素分类和 WSJ 语音识别上达到了新的 state of the art。

关键词

引用

@article{arxiv.1910.05453,
  title  = {vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations},
  author = {Alexei Baevski and Steffen Schneider and Michael Auli},
  journal= {arXiv preprint arXiv:1910.05453},
  year   = {2020}
}