应用于语音任务的用于语言模型预训练的 ASR 生成文本
计算与语言
2022-07-06 v1
摘要
我们旨在利用大量自动转写的语音来改进口语语言建模(LM)。我们利用 INA(法国国家视听研究所)的收藏,在对 350,000 小时的多样化电视节目应用 ASR 后获得了 19GB 文本。由此,口语语言模型通过微调现有 LM(FlauBERT)或从零开始训练 LM 来训练。新模型(FlauBERT-Oral)与社区共享,并针对 3 个下游任务进行评估:口语语言理解、电视节目分类和语音句法解析。结果表明,与其初始的 FlauBERT 版本相比,FlauBERT-Oral 可能更有益,这表明尽管具有固有的噪声性质,ASR 生成的文本可用于构建口语语言模型。
引用
@article{arxiv.2207.01893,
title = {ASR-Generated Text for Language Model Pre-training Applied to Speech Tasks},
author = {Valentin Pelloin and Franck Dary and Nicolas Herve and Benoit Favre and Nathalie Camelin and Antoine Laurent and Laurent Besacier},
journal= {arXiv preprint arXiv:2207.01893},
year = {2022}
}
备注
Interspeech 2022 (Camera Ready)