语音语言识别的预训练方法:TalTech对OLR 2021挑战赛的提交
音频与语音处理
2022-05-17 v1 计算与语言
摘要
本文研究了语音语言识别的不同预训练方法。本文基于我们对东方语言识别2021挑战赛的提交。我们参与了该挑战赛的两个赛道:受限与非受限语言识别。对于受限赛道,我们首先使用提供的带有可用转写文本的训练数据,训练了一个基于Conformer的编码器-解码器多语言自动语音识别(ASR)模型。该多语言ASR模型的共享编码器随后被微调用于语言识别任务。对于非受限任务,我们依赖外部可用的预训练模型以及外部数据:多语言XLSR-53 wav2vec2.0模型在VoxLingua107语料库上微调用于语言识别任务,并最终在使用CommonVoice数据增强的所提供的目标语言训练数据上微调。我们在测试集上的主要指标值为受限任务0.0079、非受限任务0.0119,在两个排名中均获第二名。在评测后实验中,我们研究了训练准确后端模型所需的目标语言数据量、多语言预训练数据的重要性,并比较了不同模型作为微调起点的表现。
引用
@article{arxiv.2205.07083,
title = {Pretraining Approaches for Spoken Language Recognition: TalTech Submission to the OLR 2021 Challenge},
author = {Tanel Alumäe and Kunnar Kukk},
journal= {arXiv preprint arXiv:2205.07083},
year = {2022}
}
备注
Accepted to Speaker Odyssey 2022