中文

为赋能波斯语问答系统的丰富数据集构建

计算与语言 2024-12-31 v1 人工智能

摘要

问答系统提供简短、精确且具体的答案.迄今为止,已为英语开发了许多健壮的问答系统,而一些资源较少的语言(如波斯语)则几乎没有标准数据集.本研究提出了用于波斯语的全面开放域数据集.该数据集称为 NextQuAD,包含 7,515 个上下文,包括 23,918 个问题和答案.随后,已对该数据集应用基于 BERT 的问答模型,使用包括 ParsBERT 和 XLM-RoBERTa 在内的两个预训练语言模型.这两个模型的结果通过平均 logits 进行集成.开发集上的评估显示 0.95 的精确匹配(EM)和 0.97 的 Fl_score.为了将 NextQuAD 与其他波斯语数据集进行比较,我们在 NextQuAD 上训练的模型被评估为两个其他数据集 named PersianQA 和 ParSQuAD.比较结果显示,该提议模型在 PersianQA 和 ParSQuAD-manual 分别提高了 0.39 和 0.14,而在 ParSQuAD-automatic 上出现了约 0.007 的轻微 EM 下降。

关键词

引用

@article{arxiv.2412.20212,
  title  = {Building a Rich Dataset to Empower the Persian Question Answering Systems},
  author = {Mohsen Yazdinejad and Marjan Kaedi},
  journal= {arXiv preprint arXiv:2412.20212},
  year   = {2024}
}