Killkan:面向基切瓦语的自动语音识别数据集
计算与语言
2024-04-25 v1 人工智能
摘要
本文介绍Killkan,这是第一个面向基切瓦语(Kichwa)的自动语音识别(ASR)数据集。基切瓦语是厄瓜多尔的一个极度资源匮乏的濒危语言,此前尚无任何Killkan数据集可用于自然语言处理应用。数据集包含约4小时的音频,附带转录、西班牙语翻译以及采用通用依赖(Universal Dependencies)格式的句法注释。音频数据来自公开的基切瓦语广播节目。本文还提供了数据集的语料学分析,重点关注基切瓦语的屈折化 morphology以及与西班牙语的频繁代码切换。实验表明,该数据集使即使在数据集较小的情况下,也能开发出质量可靠的基切瓦语ASR系统。该数据集、ASR模型以及用于开发的程序将公开提供。因此,我们的研究积极展示了为资源匮乏语言及其社区构建资源及其应用的潜力。
引用
@article{arxiv.2404.15501,
title = {Killkan: The Automatic Speech Recognition Dataset for Kichwa with Morphosyntactic Information},
author = {Chihiro Taguchi and Jefferson Saransig and Dayana Velásquez and David Chiang},
journal= {arXiv preprint arXiv:2404.15501},
year = {2024}
}
备注
11 pages, 9 tables, 3 figures, to be published in LREC-COLING 2024