中文

用于大规模测量印度阅读水平的数据集

音频与语音处理 2020-02-14 v2 计算机与社会 机器学习 声音 机器学习

摘要

印度每四个儿童中就有一个在离开八年级时仍不具备基本阅读技能。在印度这样幅员辽阔的国家测量阅读水平存在重大障碍。机器学习的最新进展为自动化该任务提供了可能。然而,儿童语音数据集不仅稀少,而且主要为英文。为解决这一评估问题并推进印度区域语言的深度学习研究,我们提出了6-14岁年龄组儿童的ASER数据集。该数据集包含5301名受试者生成的81330条印地语、马拉地语和英语标注音频片段。这些标签代表专家对儿童在指定水平阅读能力的判断。利用该数据集,我们构建了一个简单的基于ASR的分类器。早期结果表明,对英语可实现86%的预测准确率。考虑到ASER调查覆盖五十万名受试者,该数据集可扩展至此类规模。

关键词

引用

@article{arxiv.1912.04381,
  title  = {A Dataset for measuring reading levels in India at scale},
  author = {Dolly Agarwal and Jayant Gupchup and Nishant Baghel},
  journal= {arXiv preprint arXiv:1912.04381},
  year   = {2020}
}

备注

5 pages, 3 figures, 3 Tables, Paper accepted to ICASSP 2020