中文

廉价且有效?面向低资源机器阅读的简单高效数据增强

计算与语言 2021-06-09 v1 人工智能 机器学习

摘要

我们提出了一种简单而有效的低资源机器阅读理解(MRC)数据增强策略。我们的方法首先在包含正确答案近似上下文的增强数据上预训练MRC系统的答案抽取组件,再于精确答案片段上训练之。近似上下文有助于问答方法组件缩小答案定位范围。我们证明,通过提供更广的答案上下文与额外的训练数据,这一简单策略显著提升了文档检索与答案抽取性能。具体而言,在复杂低资源MRC任务TechQA上,我们的方法显著提升了基于BERT的检索器(15.12%)与答案抽取器(4.33% F1)的性能。此外,在另一实用且规模适中的长答案片段问答数据集PolicyQA上,我们的数据增强策略使答案抽取的精确匹配(EM)提升高达3.9%,F1提升2.7%。

关键词

引用

@article{arxiv.2106.04134,
  title  = {Cheap and Good? Simple and Effective Data Augmentation for Low Resource Machine Reading},
  author = {Hoang Van and Vikas Yadav and Mihai Surdeanu},
  journal= {arXiv preprint arXiv:2106.04134},
  year   = {2021}
}

备注

5 pages, 1 figure, SIGIR 2021