中文

SwaQuAD-24:斯瓦希里语问答基准数据集

计算与语言 2024-10-21 v1 人工智能

摘要

本文提出了创建斯瓦希里语问答(QA)基准数据集,旨在解决斯瓦希里语在自然语言处理(NLP)中代表性不足的问题。该数据集借鉴了SQuAD、GLUE、KenSwQuAD和KLUE等成熟基准,专注于提供高质量、带注释的问答对,以捕捉斯瓦希里语的语言多样性和复杂性。该数据集旨在支持多种应用,包括机器翻译、信息检索以及医疗聊天机器人等社会服务。数据隐私、偏见缓解和包容性等伦理考虑是数据集开发的核心。此外,本文概述了未来的扩展计划,包括特定领域内容、多模态集成和更广泛的众包工作。斯瓦希里语QA数据集旨在促进东非的技术创新,并为低资源语言的NLP研究和应用提供重要资源。

关键词

引用

@article{arxiv.2410.14289,
  title  = {SwaQuAD-24: QA Benchmark Dataset in Swahili},
  author = {Alfred Malengo Kondoro},
  journal= {arXiv preprint arXiv:2410.14289},
  year   = {2024}
}