中文

MAUPQA:大规模自动构建的波兰语问答数据集

计算与语言 2023-05-10 v1

摘要

近来,开放域问答系统已开始严重依赖标注数据集来训练神经段落检索器。然而,人工标注此类数据集既困难又耗时,这限制了其在较冷门语言上的可用性。在本工作中,我们尝试了多种自动收集弱标注数据集的方法,并展示了它们如何影响神经段落检索模型的性能。作为我们工作的成果,我们发布了MAUPQA数据集,包含近400,000个波兰语问题-段落对,以及HerBERT-QA神经检索器。

关键词

引用

@article{arxiv.2305.05486,
  title  = {MAUPQA: Massive Automatically-created Polish Question Answering Dataset},
  author = {Piotr Rybak},
  journal= {arXiv preprint arXiv:2305.05486},
  year   = {2023}
}