为伊散语音语料库的开发
计算与语言
2025-12-05 v1
摘要
本文介绍了开发首个伊散语开放对话语音数据集的过程。伊散语是泰国最广泛使用的地区方言。不同于现有基于阅读或脚本语音的数据集,本数据集由自然语音组成,捕获了真实语言现象,如口语、非正式韵律、语流不连贯现象以及频繁的中英混合。构建这一资源的关键挑战在于缺乏伊散语的标准拼写方案。当前的书写实践差异很大,这是由于泰语与伊散语之间词汇音调的不同所致。这一差异性使数据标注指南的设计复杂化,并提出关于一致性、可用性和语言真实性的问题。为此,我们建立了实用的标注协议,在代表性准确性与计算处理需求之间取得平衡。通过将此数据集作为开放资源发布,我们旨在促进包容性人工智能发展,支持少数语言研究,并为建模对话语音所固有的语言与技术挑战提供基础。
引用
@article{arxiv.2511.21229,
title = {Developing an Open Conversational Speech Corpus for the Isan Language},
author = {Adisai Na-Thalang and Chanakan Wittayasakpan and Kritsadha Phatcharoen and Supakit Buakaw},
journal= {arXiv preprint arXiv:2511.21229},
year = {2025}
}
备注
31 pages, in Thai language, 3 figures, 25 tables