埃塞图框架:面向低资源语言的可持续数据治理与 curated 框架
计算与语言
2025-06-13 v2
摘要
本文提出了埃塞图框架(Esethu Framework),这是一种专为赋能当地社区并确保其语言资源受到公平分配而设计的可持续数据 curated 框架。该框架由埃塞图许可证(Esethu license)提供支持,这是一种新型的社区中心数据许可证。作为概念验证,我们介绍了 Vuk'uzenzele isiXhosa Speech Dataset(ViXSD),这是在埃塞图框架和许可证下开发的开源语料库。该数据集包含来自 isiXhosa 母语者的朗读语音,并丰富了人口学和语言学元数据,展示了社区驱动的许可证和 curated 原则如何在非洲语言自动语音识别(ASR)中弥合资源差距,同时维护数据创建者的利益。我们描述了指导数据集开发的框架,概述了埃塞图许可证条款,呈现了 ViXSD 的方法论,并展示了针对 isiXhosa 语音应用构建与优化的 ASR 实验结果,验证了 ViXSD 在构建和细化面向 isiXhosa 的语音驱动应用中的可用性。
引用
@article{arxiv.2502.15916,
title = {The Esethu Framework: Reimagining Sustainable Dataset Governance and Curation for Low-Resource Languages},
author = {Jenalea Rajab and Anuoluwapo Aremu and Everlyn Asiko Chimoto and Dale Dunbar and Graham Morrissey and Fadel Thior and Luandrie Potgieter and Jessico Ojo and Atnafu Lambebo Tonja and Maushami Chetty and Wilhelmina NdapewaOnyothi Nekoto and Pelonomi Moiloa and Jade Abbott and Vukosi Marivate and Benjamin Rosman},
journal= {arXiv preprint arXiv:2502.15916},
year = {2025}
}