一个众包开源哈萨克语语音语料库及初步语音识别基线
音频与语音处理
2021-07-22 v2 计算与语言
声音
摘要
我们提出一个开源的哈萨克语语音语料库。哈萨克语语音语料库(KSC)包含约 332 小时转写音频,涵盖超过 153,000 条由来自不同地区、年龄组及两种性别的参与者所说的语句。它由母语为哈萨克语者仔细审校以确保高质量。KSC 是为推进各种哈萨克语语音与语言处理应用而开发的最大公开可用数据库。本文中,我们首先描述数据收集与预处理流程,随后说明数据库规范。我们也分享在数据库构建过程中遇到的经验与挑战,这可能有益于计划为低资源语言构建语音语料库的其他研究者。为展示数据库的可靠性,我们进行了初步语音识别实验。实验结果表明音频与转写文本质量良好(测试集上字符错误率 2.8%,词错误率 8.7%)。为便于实验复现与语料库使用,我们也发布了我们语音识别模型的 ESPnet 配方。
引用
@article{arxiv.2009.10334,
title = {A Crowdsourced Open-Source Kazakh Speech Corpus and Initial Speech Recognition Baseline},
author = {Yerbolat Khassanov and Saida Mussakhojayeva and Almas Mirzakhmetov and Alen Adiyev and Mukhamet Nurpeiissov and Huseyin Atakan Varol},
journal= {arXiv preprint arXiv:2009.10334},
year = {2021}
}
备注
10 pages, 5 figures, 4 tables, accepted by EACL2021