面向问答系统领域自适应的端到端合成数据生成
计算与语言
2020-10-14 v1
摘要
我们提出一种端到端的合成问答数据生成方法。我们的模型由一个单一的基于Transformer的编码器-解码器网络组成,该网络经端到端训练以同时生成答案和问题。简言之,我们将一段文本输入编码器,并让解码器逐词元生成问题和答案。生成过程中产生的概率被用作过滤分数,从而避免了单独过滤模型的需要。我们的生成器通过最大似然估计微调预训练语言模型来训练。实验结果表明,问答模型的领域自适应得到显著改进,优于当前最先进的方法。
引用
@article{arxiv.2010.06028,
title = {End-to-End Synthetic Data Generation for Domain Adaptation of Question Answering Systems},
author = {Siamak Shakeri and Cicero Nogueira dos Santos and Henry Zhu and Patrick Ng and Feng Nan and Zhiguo Wang and Ramesh Nallapati and Bing Xiang},
journal= {arXiv preprint arXiv:2010.06028},
year = {2020}
}
备注
EMNLP 2020