UQA:面向乌尔都语问答的语料库
计算与语言
2024-07-24 v2 人工智能
信息检索
机器学习
摘要
本文介绍了 UQA,一个用于乌尔都语(一种拥有超过 7000 万母语者的低资源语言)问答和文本理解的新颖数据集。UQA 是通过使用一种称为 EATS(Enclose to Anchor, Translate, Seek)的技术翻译 Stanford Question Answering Dataset (SQuAD2.0)(一个大规模英语问答数据集)而生成的,该技术在翻译后的上下文段落中保留了答案跨度。本文描述了在两个候选模型:Google Translator 和 Seamless M4T 之间选择和评估最佳翻译模型的过程。本文还在 UQA 上对几种最先进的多语言问答模型进行了基准测试,包括 mBERT、XLM-RoBERTa 和 mT5,并报告了有希望的结果。对于 XLM-RoBERTa-XL,我们获得了 85.99 的 F1 分数和 74.56 的 EM。UQA 是开发和测试乌尔都语多语言 NLP 系统以及增强现有模型跨语言可迁移性的宝贵资源。此外,本文证明了 EATS 在为其他语言和领域创建高质量数据集方面的有效性。UQA 数据集和代码已在 www.github.com/sameearif/UQA 上公开提供。
引用
@article{arxiv.2405.01458,
title = {UQA: Corpus for Urdu Question Answering},
author = {Samee Arif and Sualeha Farid and Awais Athar and Agha Ali Raza},
journal= {arXiv preprint arXiv:2405.01458},
year = {2024}
}