文本转语音伪标签用于强制对齐及跨语言预训练模型在低资源语音识别中的有效性
计算与语言
2022-04-01 v1 声音
音频与语音处理
摘要
近年来,在资源充足条件下端到端(E2E)自动语音识别(ASR)系统已取得令人瞩目的结果。即便对于标注数据不多的语言,也可通过在高资源语言上预训练并在低资源语言上微调,开发出最先进的 E2E ASR 系统。对许多低资源语言而言,当前方法仍具挑战性,因为大量情况下开放域中并无标注数据可用。本文提出一种利用文本转语音伪标签进行强制对齐,为 Maithili、Bhojpuri 与 Dogri 创建标注数据的方法。所创建数据经质量核查后,进一步用于训练基于 transformer 的 wav2vec 2.0 ASR 模型。所有数据与模型均开放获取。
引用
@article{arxiv.2203.16823,
title = {Effectiveness of text to speech pseudo labels for forced alignment and cross lingual pretrained models for low resource speech recognition},
author = {Anirudh Gupta and Rishabh Gaur and Ankur Dhuriya and Harveen Singh Chadha and Neeraj Chhimwal and Priyanshi Shah and Vivek Raghavan},
journal= {arXiv preprint arXiv:2203.16823},
year = {2022}
}
备注
Submitted to InterSpeech 2022