从公共数据挖掘音频与文本对以改进低资源语言 ASR 系统的有效性
计算与语言
2022-08-29 v1 声音
音频与语音处理
摘要
端到端(E2E)模型已成为最先进语音识别系统的默认选择。此类模型在大量标注数据上进行训练,而这些数据对于低资源语言通常不可用。诸如自监督学习与迁移学习等技术展现出潜力,但在训练高精度模型方面尚未见效。另一方面,在多种不同领域和说话人上收集标注数据集非常昂贵。在这项工作中,我们通过从公共来源(特别是全印广播电台的公共档案库)为印度语言“挖掘”文本与音频对,展示了一种廉价且有效的替代方法。作为关键组件,我们改进了 Needleman-Wunsch 算法,在给定长音频及其转录本的 PDF 的情况下,将句子与相应的音频片段对齐,同时对 OCR 错误、无关文本和未转录语音具有鲁棒性。由此,我们创建了 Shrutilipi,这是一个包含超过 6,400 小时标注音频的数据集,涵盖 12 种印度语言,总计 495 万个句子。平均而言,Shrutilipi 使得公开可用的标注数据量增加了 2.3 倍。我们通过 12 种语言的 21 名人工评估者确立了 Shrutilipi 的质量。我们还确立了 Shrutilipi 在所代表的地区、说话人和提及的命名实体方面的多样性。值得注意的是,我们展示了将 Shrutilipi 添加到 Wav2Vec 模型的训练集中,在 IndicSUPERB 基准测试上使 7 种语言的 WER 平均降低了 5.8%。对于拥有最多基准测试(7 个)的印地语,平均 WER 从 18.8% 降至 13.5%。这种改进也扩展到了高效模型:我们展示了 Conformer 模型(比 Wav2Vec 小 10 倍)的 WER 降低了 2.3%。最后,我们通过展示使用它训练的模型对噪声输入更具鲁棒性,证明了 Shrutilipi 的多样性。
引用
@article{arxiv.2208.12666,
title = {Effectiveness of Mining Audio and Text Pairs from Public Data for Improving ASR Systems for Low-Resource Languages},
author = {Kaushal Santosh Bhogale and Abhigyan Raman and Tahir Javed and Sumanth Doddapaneni and Anoop Kunchukuttan and Pratyush Kumar and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2208.12666},
year = {2022}
}