中文

弥合语言模型与阅读理解之间的鸿沟:基于自监督的无监督机器阅读理解

计算与语言 2021-07-20 v1

摘要

尽管机器阅读理解(MRC)近期取得了成功,但学习高质量的 MRC 模型仍需要大规模标注训练数据,即便使用强大的预训练语言模型(PLM)。PLM 的预训练任务并非问答或基于 MRC 的任务,使得现有 PLM 无法直接用于无监督 MRC。具体而言,MRC 旨在从给定文档中定位准确的答案片段,而 PLM 侧重于句子中的词元填充。本文提出了一种用于无监督 MRC 的新框架。首先,我们通过设计一种面向 MRC 的自监督前置任务——Spotting-MLM,利用自监督学习来学习在文档中定位答案片段。解决该任务需要捕获文档中句子间的深层交互。其次,我们在推理阶段采用简单的句子改写策略,以缓解问题与文档之间的表达不匹配。实验表明,我们的方法在无监督 MRC 上取得了新的 SOTA 性能。

关键词

引用

@article{arxiv.2107.08582,
  title  = {Bridging the Gap between Language Model and Reading Comprehension: Unsupervised MRC via Self-Supervision},
  author = {Ning Bian and Xianpei Han and Bo Chen and Hongyu Lin and Ben He and Le Sun},
  journal= {arXiv preprint arXiv:2107.08582},
  year   = {2021}
}