IndicSUPERB:面向印度语言的语音处理通用性能基准
计算与语言
2022-12-16 v2 声音
音频与语音处理
摘要
AI 研究的一个基石是创建并采用标准化训练与测试数据集,以标定最先进模型的进展。一个尤为成功的例子是用于英语自然语言理解(NLU)模型训练与评估的 GLUE 数据集。围绕自监督基于 BERT 的语言模型的大量研究都围绕 GLUE 上 NLU 任务的性能提升展开。为评估其他语言中的语言模型,研究者创建了若干语言特定的 GLUE 数据集。语音语言理解(SLU)领域也遵循了类似轨迹。wav2vec2 等大型自监督模型的成功使得利用相对易获取的无标注数据创建语音模型成为可能。这些模型随后可在 SLU 任务上评估,例如 SUPERB 基准。在本工作中,我们通过发布 IndicSUPERB 基准将之扩展到印度语言。具体而言,我们做出以下三点贡献。(i)我们收集了 Kathbath,其包含来自印度 203 个地区 1218 名贡献者的 12 种印度语言共 1684 小时标注语音数据。(ii)利用 Kathbath,我们为 12 种语言创建了涵盖 6 项语音任务的基准:自动语音识别、说话人验证、说话人识别(单/多)、语言识别、示例查询和关键词 spotting(关键词 spotting)。(iii)在发布的基准上,我们训练并评估了不同的自监督模型以及常用基线 FBANK。我们表明,在大多数任务上,语言特定的微调模型比基线更准确,其中语言识别任务上存在 76% 的巨大差距。然而,对于说话人识别,在大型数据集上训练的自监督模型展现出优势。我们希望 IndicSUPERB 能推动印度语言语音语言理解模型的发展。
引用
@article{arxiv.2208.11761,
title = {IndicSUPERB: A Speech Processing Universal Performance Benchmark for Indian languages},
author = {Tahir Javed and Kaushal Santosh Bhogale and Abhigyan Raman and Anoop Kunchukuttan and Pratyush Kumar and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2208.11761},
year = {2022}
}