基于自回归预测编码的语音生成式预训练
音频与语音处理
2020-01-28 v2 计算与语言
机器学习
声音
摘要
从无标注语音中学习有意义且通用的表示,并将其应用于广泛任务,仍然具有挑战性。本文提出使用自回归预测编码(APC),这是一种近期提出的自监督目标,作为生成式预训练方法,以学习有意义、非特定且可迁移的语音表示。我们在大规模无标注数据上预训练 APC,并在三个需要不同语音特征信息才能表现良好的语音应用上进行迁移学习实验:语音识别、语音翻译和说话人识别。大量实验表明,APC 不仅在这三项任务上优于表面特征(例如 log Mel 频谱图)和其他流行的表示学习方法,而且能有效减少下游任务所需的标注数据量和模型参数量。我们还研究了使用 Transformer 对 APC 进行建模,发现其优于 RNN。
引用
@article{arxiv.1910.12607,
title = {Generative Pre-Training for Speech with Autoregressive Predictive Coding},
author = {Yu-An Chung and James Glass},
journal= {arXiv preprint arXiv:1910.12607},
year = {2020}
}
备注
Accepted to ICASSP 2020. Code and pre-trained models are available at https://github.com/iamyuanchung/Autoregressive-Predictive-Coding