HuBERT:通过隐藏单元的掩码预测进行自监督语音表征学习
计算与语言
2021-06-15 v1 人工智能
机器学习
音频与语音处理
摘要
语音表征学习的自监督方法面临三个独特问题:(1) 每个输入语句中有多个声音单元,(2) 预训练阶段没有输入声音单元的词典,以及 (3) 声音单元长度可变且无显式分割。为应对这三个问题,我们提出 Hidden-Unit BERT (HuBERT) 自监督语音表征学习方法,其利用离线聚类步骤为类 BERT 预测损失提供对齐的目标标签。我们方法的关键要素是仅对掩码区域施加预测损失,这迫使模型在连续输入上学习声学与语言联合模型。HuBERT 主要依赖无监督聚类步骤的一致性,而非所分配聚类标签的内在质量。从 100 个聚类的简单 k-means teacher 出发,并使用两次聚类迭代,HuBERT 模型在 Librispeech (960h) 和 Libri-light (60,000h) 基准上,使用 10min、1h、10h、100h 和 960h 微调子集,达到或超越了最先进的 wav2vec 2.0 性能。使用 1B 参数模型,HuBERT 在更具挑战性的 dev-other 和 test-other 评估子集上分别显示出高达 19% 和 13% 的相对 WER 降低。
引用
@article{arxiv.2106.07447,
title = {HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units},
author = {Wei-Ning Hsu and Benjamin Bolte and Yao-Hung Hubert Tsai and Kushal Lakhotia and Ruslan Salakhutdinov and Abdelrahman Mohamed},
journal= {arXiv preprint arXiv:2106.07447},
year = {2021}
}