TIGQA:面向 Tigrinya 语的专家标注问答数据集
计算与语言
2024-04-29 v1
摘要
缺乏为教育目的量身定制且易于访问的标注数据集,构成了语言资源有限地区 NLP 任务的显著障碍。本文初步探讨了使用机器翻译 (MT) 将现有数据集转换为 Tigrinya 语数据集的可行性。结果我们提出 TIGQA,一个由专家标注的教育数据集,包含 2.68K 问答对,覆盖 122 个多样化主题,如气候、水资源和交通。这些问答对来自 537 个公开可访问的 Tigrinya 语和生物学教材中的语境段落。通过全面分析,我们证明 TIGQA 数据集需要超越简单词匹配的技能,要求单句和多句推理能力。我们对使用最新 MRC 方法进行实验,标志着在 TIGQA 上首次探索此类模型。此外,我们估计了人类在该数据集上的表现,并与预训练模型的结果进行对比。人类表现与最佳模型表现之间的显著差异,凸显了通过持续研究进一步提升 TIGQA 的潜力。该数据集通过提供链接可免费获取,以鼓励研究社区解决 Tigrinya 语 MRC 挑战。
关键词
引用
@article{arxiv.2404.17194,
title = {TIGQA:An Expert Annotated Question Answering Dataset in Tigrinya},
author = {Hailay Teklehaymanot and Dren Fazlija and Niloy Ganguly and Gourab K. Patro and Wolfgang Nejdl},
journal= {arXiv preprint arXiv:2404.17194},
year = {2024}
}
备注
9 pages,3 figures, 7 tables,2 listings