中文

FarsTail:一个波斯语自然语言推理数据集

计算与语言 2023-07-25 v2

摘要

自然语言推理(NLI)被认为是自然语言处理(NLP)中的核心任务之一,它囊括了语言理解的许多基本方面。随着数据驱动的深度学习在 NLP 任务中取得显著成就,人们已投入大量精力为不同语言开发更加多样化的数据集。在本文中,我们提出了一个用于波斯语(又称法尔斯语,中东地区的主要语言之一)NLI 任务的新数据集。该数据集名为 FarsTail,包含 10,367 个样本,以波斯语和索引格式双重提供,以便对非波斯语研究者也有所帮助。样本由 3,539 道多选题生成,标注者干预最少,其方式与 SciTail 数据集类似。我们采用精心设计的多步流程以确保数据集质量。我们还给出了传统方法与 SOTA 方法在 FarsTail 上的结果,包括 word2vec、fastText、ELMo、BERT 和 LASER 等不同嵌入方法,以及 DecompAtt、ESIM、HBMP 和 ULMFiT 等不同建模方法,为未来研究提供坚实基线。所获得的最佳测试准确率为 83.38%,这表明当前方法仍有很大改进空间,以适用于不同语言的实际 NLP 应用。我们还考察了模型在 FarsTail 中利用表层线索(即数据集偏差)的程度,并根据有偏模型的成功与否将测试集划分为简单和困难两个子集。数据集可在 https://github.com/dml-qom/FarsTail 获取。

关键词

引用

@article{arxiv.2009.08820,
  title  = {FarsTail: A Persian Natural Language Inference Dataset},
  author = {Hossein Amirkhani and Mohammad AzariJafari and Zohreh Pourjafari and Soroush Faridan-Jahromi and Zeinab Kouhkan and Azadeh Amirak},
  journal= {arXiv preprint arXiv:2009.08820},
  year   = {2023}
}