中文

GermanQuAD与GermanDPR:改进非英语问答与段落检索

计算与语言 2021-04-27 v1 机器学习

摘要

非英语机器阅读理解问答(QA)研究的一大挑战是缺乏标注数据集。本文我们提出GermanQuAD,一个包含13,722个抽取式问答对的数据集。为提升数据集构建方法的可复现性并推动其他语言的QA研究,我们总结了经验教训,并评估将问答对改写作为加速标注过程的途径。在GermanQuAD上训练的抽取式QA模型显著优于多语言模型,同时也表明机器翻译的训练数据无法完全替代目标语言中人工标注的训练数据。最后,我们通过将GermanQuAD适配为稠密段落检索(DPR)的训练数据集GermanDPR,展示了其广泛应用,并训练与评估了首个非英语DPR模型。

关键词

引用

@article{arxiv.2104.12741,
  title  = {GermanQuAD and GermanDPR: Improving Non-English Question Answering and Passage Retrieval},
  author = {Timo Möller and Julian Risch and Malte Pietsch},
  journal= {arXiv preprint arXiv:2104.12741},
  year   = {2021}
}

备注

See https://deepset.ai/germanquad for downloading the datasets and models