监督引导码本用于语音预训练中的掩码预测
计算与语言
2022-06-22 v1 声音
音频与语音处理
摘要
近年来,掩码预测预训练在语音识别的自监督学习(SSL)中取得了显著进展。它通常需要以无监督方式获得的码本,导致其准确性较低且难以解释。我们提出两种监督引导的码本生成方法,以改进自动语音识别(ASR)性能及预训练效率:一种是通过混合ASR系统解码生成音素级对齐(称为PBERT),另一种是对端到端CTC模型提取的有监督语音特征进行聚类(称为CTC聚类)。混合模型与CTC模型均在微调所用的同等少量标注语音上训练。实验表明,我们的方法相对于多种SSL与自训练基线具有显著优势,相对词错率(WER)最高降低17.0%。我们的预训练模型在非ASR语音任务中也展现出良好的可迁移性。
引用
@article{arxiv.2206.10125,
title = {Supervision-Guided Codebooks for Masked Prediction in Speech Pre-training},
author = {Chengyi Wang and Yiming Wang and Yu Wu and Sanyuan Chen and Jinyu Li and Shujie Liu and Furu Wei},
journal= {arXiv preprint arXiv:2206.10125},
year = {2022}
}
备注
To appear in Proc. Interspeech 2022