反向训练在无监督领域自适应的问答生成与段落检索中优于自训练
计算与语言
2021-09-10 v2 人工智能
机器学习
摘要
在本工作中,我们提出反向训练(back-training),作为从源领域到目标领域的无监督领域自适应(UDA)中自训练的一种替代方法。自训练生成自然输入与含噪输出对齐的合成训练数据,而反向训练产生自然输出与含噪输入对齐的数据。这显著缩小了目标领域与合成数据分布之间的差距,并减少了模型对源领域的过拟合。我们在从 Natural Questions 领域到机器学习与生物医学领域的问答生成和段落检索上进行了 UDA 实验。我们发现反向训练大幅优于自训练,在生成任务上平均提升 7.8 个 BLEU-4 点,在两个领域的 top-20 检索准确率上提升 17.6%。我们进一步提出一致性过滤器,以在训练前剔除低质量合成数据。我们还发布了一个新的领域自适应数据集——MLQuestions,包含 35K 个未对齐问题、50K 个未对齐段落以及 3K 个对齐的问题-段落对。
引用
@article{arxiv.2104.08801,
title = {Back-Training excels Self-Training at Unsupervised Domain Adaptation of Question Generation and Passage Retrieval},
author = {Devang Kulshreshtha and Robert Belfer and Iulian Vlad Serban and Siva Reddy},
journal= {arXiv preprint arXiv:2104.08801},
year = {2021}
}
备注
EMNLP 2021