Mockingjay:基于深度双向 Transformer 编码器的无监督语音表征学习
音频与语音处理
2020-04-24 v2 计算与语言
机器学习
声音
摘要
我们提出 Mockingjay 作为一种新的语音表征学习方法,其中双向 Transformer 编码器在大量无标签语音上进行预训练。以往的语音表征方法通过以过去帧为条件并预测未来帧的信息来学习。而 Mockingjay 被设计为通过联合以过去和未来上下文为条件来预测当前帧。Mockingjay 表征提升了广泛下游任务的性能,包括音素分类、说话人识别以及口语内容的情感分类,同时优于其他方法。Mockingjay 在经验上十分强大,并可与下游模型微调,仅用 2 个 epoch 我们便进一步大幅提升了性能。在仅使用 0.1% 标签数据的低资源设定下,我们优于使用全部 100% 标签数据的梅尔特征的结果。
引用
@article{arxiv.1910.12638,
title = {Mockingjay: Unsupervised Speech Representation Learning with Deep Bidirectional Transformer Encoders},
author = {Andy T. Liu and Shu-wen Yang and Po-Han Chi and Po-chun Hsu and Hung-yi Lee},
journal= {arXiv preprint arXiv:1910.12638},
year = {2020}
}
备注
Accepted by ICASSP 2020, Lecture Session