中文

UQuAD1.0:面向机器阅读理解的乌尔都语问答训练数据开发

计算与语言 2021-11-04 v1 人工智能

摘要

近年来,低资源机器阅读理解(MRC)取得了显著进展,模型在各种语言数据集上表现出色。然而,这些模型均未针对乌尔都语进行定制。本工作探索了通过结合机器翻译的SQuAD与源自维基百科文章和剑桥O-level书籍中乌尔都语RC练习题的人工生成样本,半自动化创建乌尔都语问答数据集(UQuAD1.0)的方法。UQuAD1.0是一个大规模乌尔都语数据集,旨在用于抽取式机器阅读理解任务,包含49,000个以问题、段落和答案格式组织的问答对。在UQuAD1.0中,45,000对问答通过原始SQuAD1.0的机器翻译生成,约4,000对通过众包生成。在本研究中,我们使用了两种类型的MRC模型:基于规则的基线模型和先进的Transformer模型。然而,我们发现后者性能更优,因此决定仅专注于基于Transformer的架构。使用XLMRoBERTa和多语言BERT,我们分别获得了0.66和0.63的F1分数。

关键词

引用

@article{arxiv.2111.01543,
  title  = {UQuAD1.0: Development of an Urdu Question Answering Training Data for Machine Reading Comprehension},
  author = {Samreen Kazi and Shakeel Khoja},
  journal= {arXiv preprint arXiv:2111.01543},
  year   = {2021}
}

备注

22 pages, 6 figures