中文

为波兰语开发 PUGG:KBQA、MRC 与 IR 数据集构建的现代方法

人工智能 2024-08-06 v1 计算与语言 机器学习

摘要

人工智能和自然语言处理的进步彻底改变了机器与人类之间的语言交互,问答(QA)系统在其中发挥着关键作用。知识库问答(KBQA)任务利用结构化知识图谱(KG),能够处理大量知识密集型问题。然而,KBQA 数据集存在显著空白,尤其是低资源语言。许多现有数据集构建流程已过时且在人工劳动方面效率低下,而现代辅助工具如大语言模型(LLM)未被用于减轻工作负载。为解决这一问题,我们设计并实现了一种现代半自动化方法,用于创建涵盖 KBQA、机器阅读理解(MRC)和信息检索(IR)任务的数据集,专门针对低资源环境。我们执行了该流程并推出了 PUGG 数据集——首个波兰语 KBQA 数据集,以及 MRC 和 IR 的新数据集。此外,我们提供了全面的实现、深刻的发现、详细的统计数据和基线模型的评估。

关键词

引用

@article{arxiv.2408.02337,
  title  = {Developing PUGG for Polish: A Modern Approach to KBQA, MRC, and IR Dataset Construction},
  author = {Albert Sawczyn and Katsiaryna Viarenich and Konrad Wojtasik and Aleksandra Domogała and Marcin Oleksy and Maciej Piasecki and Tomasz Kajdanowicz},
  journal= {arXiv preprint arXiv:2408.02337},
  year   = {2024}
}

备注

Accepted for ACL 2024 (findings)