wav2vec 2.0:一种语音表征自监督学习框架
计算与语言
2020-10-23 v3 机器学习
声音
音频与语音处理
摘要
我们首次表明,仅从语音音频中学习强大表征,随后在转写语音上微调,可以在概念上更为简单的同时超越最佳的半监督方法。wav2vec 2.0 在潜空间中对语音输入进行掩码,并求解一个定义于潜表征量化上的对比任务,这些潜表征被联合学习。使用 Librispeech 全部标注数据进行的实验在 clean/other 测试集上取得 1.8/3.3 的词错率(WER)。当将标注数据量降至一小时时,wav2vec 2.0 在使用少 100 倍标注数据的情况下优于 100 小时子集上的先前最优结果。仅使用十分钟标注数据并在 53k 小时无标注数据上预训练,仍取得 4.8/8.2 WER。这证明了利用有限标注数据进行语音识别的可行性。
引用
@article{arxiv.2006.11477,
title = {wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations},
author = {Alexei Baevski and Henry Zhou and Abdelrahman Mohamed and Michael Auli},
journal= {arXiv preprint arXiv:2006.11477},
year = {2020}
}