中文

用于阅读理解任务的改进合成训练方法

计算与语言 2020-10-27 v1

摘要

自动生成的合成训练样本已被证明可提升机器阅读理解(MRC)的性能。与人工标注的黄金标准数据相比,合成训练数据具有独特的性质,例如高可用性可能以质量为代价。鉴于这些差异,本文探索了合成样本在MRC中的新颖应用。我们提出的预训练与知识蒸馏策略相比现有方法取得了显著改进。在一个尤其令人惊讶的发现中,我们观察到合成蒸馏常能产生超越教师模型的学生模型。

关键词

引用

@article{arxiv.2010.12776,
  title  = {Improved Synthetic Training for Reading Comprehension},
  author = {Yanda Chen and Md Arafat Sultan and Vittorio Castelli},
  journal= {arXiv preprint arXiv:2010.12776},
  year   = {2020}
}

备注

11 pages, 2 figures