中文

SynDARin:面向低资源语言的自动推理数据集合成方法

计算与语言 2024-09-18 v3 人工智能 机器学习

摘要

问答(QA)数据集在开发和评估大型语言模型(LLM)能力方面发挥着重要作用。然而,由于收集和人工标注的成本和困难,除英语外的其他语言数据集十分稀缺。这使得为低资源语言开发新模型并衡量多语言LLM的性能具有挑战性。为此,我们提出了一种用于生成和验证低资源语言问答数据集的方法——S\textbf{S}ynDAR\textbf{DAR}in。我们利用平行内容矿业获取英文与目标语言之间的人工筛选段落。利用英文数据作为上下文生成合成多选问答对,这些问答对被自动翻译并进一步进行质量验证。将这些数据与其对应的非英文人工筛选段落组合,即可得到最终的QA数据集。该方法能够维持内容质量,降低事实错误的可能性,同时规避了高昂的标注成本。为测试该方法,我们为阿尔美尼亚语创建了一个包含1.2千个样本的QA数据集。人类评估显示,98%的生成英文数据在问题类型和主题方面保持质量和多样性,而翻译验证管道可过滤约70%质量较差的数据。我们利用该数据集对最新LLM进行基准测试,显示其无法达到人类水平,部分模型的表现甚至接近随机猜测。这表明生成的数据集具有一定难度,可用于评估低资源语言中的推理能力。

关键词

引用

@article{arxiv.2406.14425,
  title  = {SynDARin: Synthesising Datasets for Automated Reasoning in Low-Resource Languages},
  author = {Gayane Ghazaryan and Erik Arakelyan and Pasquale Minervini and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2406.14425},
  year   = {2024}
}