利用广播档案进行低资源语音识别:面向文盲用户的智能虚拟助手
机器学习
2021-04-28 v1 人工智能
摘要
对于全球约 7 亿文盲而言,语音识别技术可作为获取宝贵信息与服务的桥梁。然而,最亟需该技术的人群往往最缺乏其服务。在许多国家,文盲往往只说低资源语言,而开发语音技术所需的数据集十分匮乏。本文中,我们研究了在噪声广播档案上进行无监督语音表示学习的有效性,这类档案即便在低资源语言中也很丰富。我们作出三项核心贡献。首先,我们向研究界发布两个数据集。第一个西非广播语料库包含超过 10 种语言的 142 小时音频及带标注的验证子集。第二个西非虚拟助手语音识别语料库由四种语言的 1 万条标注音频片段组成。其次,我们分享在西非噪声广播语料上训练的语音编码器 West African wav2vec,并与在六倍体量更高质量数据上训练的基线 Facebook 语音编码器比较。我们显示 West African wav2vec 在多语言语音识别任务上与基线表现相近,并在西非语言识别任务上显著优于基线。最后,我们分享首个针对 Maninka、Pular 和 Susu 的语音识别模型,这些语言在逾七个国家被共 1000 万人使用,其中六个国家成年人口多数文盲。我们的贡献为伦理 AI 研究服务数字鸿沟中最弱势群体的需求提供了前进路径。
引用
@article{arxiv.2104.13083,
title = {Using Radio Archives for Low-Resource Speech Recognition: Towards an Intelligent Virtual Assistant for Illiterate Users},
author = {Moussa Doumbouya and Lisa Einstein and Chris Piech},
journal= {arXiv preprint arXiv:2104.13083},
year = {2021}
}