中文

QAGAN:面向领域不变语言特征学习的对抗方法

计算与语言 2022-06-27 v1

摘要

训练对数据领域偏移具有鲁棒性的模型在学术界和工业界都获得了日益增长的关注。问答语言模型作为自然语言处理(NLP)研究中的典型问题之一,随着大型 transformer 模型的出现已取得诸多成功。然而,现有方法大多假设训练与测试时数据来自同一分布,这在不受限的真实场景中是不现实且不可扩展的。本文中,我们探索以对抗训练方法学习领域不变特征,使语言模型能很好地泛化到域外数据集。我们还考察了其他多种提升模型性能的途径,包括通过句子释义进行数据增强、将答案跨度末端预测以起始词为条件,以及精心设计的退火函数。我们的初步结果表明,这些方法相结合后,在域外验证集上相较基线取得了 EM 分数 15.2%15.2\% 的提升与 F1 分数 5.6%5.6\% 的提高。我们还剖析了模型输出,并将模型隐状态投影到低维空间进行可视化,发现我们特定的对抗训练方法确实促使模型学习领域不变嵌入,并使其在多维空间中彼此靠近。

关键词

引用

@article{arxiv.2206.12388,
  title  = {QAGAN: Adversarial Approach To Learning Domain Invariant Language Features},
  author = {Shubham Shrivastava and Kaiyue Wang},
  journal= {arXiv preprint arXiv:2206.12388},
  year   = {2022}
}