NEST-RQ:面向语音自监督预训练的下一令牌预测
音频与语音处理
2024-09-16 v1 人工智能
计算与语言
摘要
语音自监督预训练可以有效提升下游任务的性能。然而,以往的语音自监督学习方法,如 HuBERT 和 BEST-RQ,侧重于使用具有双向上下文的非因果编码器,对下游流式模型支持不足。为解决这一问题,我们引入了基于随机投影量化器的下一令牌预测语音预训练方法(NEST-RQ)。NEST-RQ 采用仅包含左侧上下文的因果编码器,并使用下一令牌预测(NTP)作为训练任务。在大规模数据集上,与 BEST-RQ 相比,所提出的 NEST-RQ 在非流式自动语音识别(ASR)上取得了可比的性能,并在流式 ASR 上取得了更优的性能。我们还就流式 ASR 的未来上下文大小、自监督学习的码本质量以及编码器的模型规模进行了分析实验。总之,本文论证了 NTP 在语音自监督学习中的可行性,并为语音自监督学习研究提供了经验证据和见解。
引用
@article{arxiv.2409.08680,
title = {NEST-RQ: Next Token Prediction for Speech Self-Supervised Pre-Training},
author = {Minglun Han and Ye Bai and Chen Shen and Youjia Huang and Mingkun Huang and Zehua Lin and Linhao Dong and Lu Lu and Yuxuan Wang},
journal= {arXiv preprint arXiv:2409.08680},
year = {2024}
}
备注
5 pages, 2 figures, Work in progress