用于阅读理解任务的改进合成训练方法
计算与语言
2020-10-27 v1
摘要
自动生成的合成训练样本已被证明可提升机器阅读理解(MRC)的性能。与人工标注的黄金标准数据相比,合成训练数据具有独特的性质,例如高可用性可能以质量为代价。鉴于这些差异,本文探索了合成样本在MRC中的新颖应用。我们提出的预训练与知识蒸馏策略相比现有方法取得了显著改进。在一个尤其令人惊讶的发现中,我们观察到合成蒸馏常能产生超越教师模型的学生模型。
引用
@article{arxiv.2010.12776,
title = {Improved Synthetic Training for Reading Comprehension},
author = {Yanda Chen and Md Arafat Sultan and Vittorio Castelli},
journal= {arXiv preprint arXiv:2010.12776},
year = {2020}
}
备注
11 pages, 2 figures