MAUPQA:大规模自动构建的波兰语问答数据集
计算与语言
2023-05-10 v1
摘要
近来,开放域问答系统已开始严重依赖标注数据集来训练神经段落检索器。然而,人工标注此类数据集既困难又耗时,这限制了其在较冷门语言上的可用性。在本工作中,我们尝试了多种自动收集弱标注数据集的方法,并展示了它们如何影响神经段落检索模型的性能。作为我们工作的成果,我们发布了MAUPQA数据集,包含近400,000个波兰语问题-段落对,以及HerBERT-QA神经检索器。
引用
@article{arxiv.2305.05486,
title = {MAUPQA: Massive Automatically-created Polish Question Answering Dataset},
author = {Piotr Rybak},
journal= {arXiv preprint arXiv:2305.05486},
year = {2023}
}