中文

面向问答系统领域自适应的端到端合成数据生成

计算与语言 2020-10-14 v1

摘要

我们提出一种端到端的合成问答数据生成方法。我们的模型由一个单一的基于Transformer的编码器-解码器网络组成,该网络经端到端训练以同时生成答案和问题。简言之,我们将一段文本输入编码器,并让解码器逐词元生成问题和答案。生成过程中产生的概率被用作过滤分数,从而避免了单独过滤模型的需要。我们的生成器通过最大似然估计微调预训练语言模型来训练。实验结果表明,问答模型的领域自适应得到显著改进,优于当前最先进的方法。

关键词

引用

@article{arxiv.2010.06028,
  title  = {End-to-End Synthetic Data Generation for Domain Adaptation of Question Answering Systems},
  author = {Siamak Shakeri and Cicero Nogueira dos Santos and Henry Zhu and Patrick Ng and Feng Nan and Zhiguo Wang and Ramesh Nallapati and Bing Xiang},
  journal= {arXiv preprint arXiv:2010.06028},
  year   = {2020}
}

备注

EMNLP 2020