中文

波斯语大规模推理问答基准PARSE

计算与语言 2026-02-03 v1 信息检索

摘要

推理导向问答(QA)技术近年来受大型语言模型(LLM)的推动迅猛发展, 但低资源语言的高质量基准数据集仍显稀缺。波斯语作为全球约有13000万使用者的语言, 目前缺乏用于评估具备推理能力QA系统的综合性开放域资源。我们首次引入PARSE, 一个针对波斯语的开放域推理问答基准, 包含10,800个问题,覆盖布尔型、选择题和事实型问答格式,涵盖多样化的推理类型、难度等级和答案结构。基准数据集通过受控的LLM生成管道构建, 并通过人类评估进行验证。我们通过多阶段筛选、标注和一致性检查确保语言和事实的质量。对多语言和波斯语LLM进行基准测试, 并探讨不同提示策略的效果, 结果表明波斯语提示和结构化提示(布尔型/选择题使用CoT; 事实型使用few-shot)可提升性能。微调进一步显著提升结果, 尤其针对波斯语专用模型效果尤为突出。上述发现表明, PARSE不仅支持公平比较, 也为开发和评估低资源环境下具备推理能力的LLM提供了坚实基础。PARSE填补了波斯语QA研究的关键空白, 为该领域的后续发展奠定了坚实基础。

关键词

引用

@article{arxiv.2602.01246,
  title  = {PARSE: An Open-Domain Reasoning Question Answering Benchmark for Persian},
  author = {Jamshid Mozafari and Seyed Parsa Mousavinasab and Adam Jatowt},
  journal= {arXiv preprint arXiv:2602.01246},
  year   = {2026}
}

备注

Submitted to SIGIR 2026