中文

DoCoGen:面向低资源领域自适应的领域反事实生成

计算与语言 2022-03-08 v2 人工智能

摘要

自然语言处理(NLP)算法已非常成功,但在应用于分布外样本时仍表现不佳。本文中,我们提出一种可控生成方法来应对这一领域自适应(DA)挑战。给定输入文本样例,我们的 DoCoGen 算法生成一个领域反事实文本样例(D-con)——其在所有方面与原始样例相似,包括任务标签,但其领域被更改为期望的领域。重要的是,DoCoGen 仅使用来自多个领域的无标签样例进行训练——不需要 NLP 任务标签或文本样例与其领域反事实的平行对。我们展示了 DoCoGen 能够生成由多个句子组成的连贯反事实。我们使用 DoCoGen 生成的 D-con 来增强情感分类器和多标签意图分类器,分别在 20 和 78 种 DA 设定中,其中源领域标注数据稀缺。我们的模型优于强基线,并提升了一个最先进的无监督 DA 算法的准确率。

关键词

引用

@article{arxiv.2202.12350,
  title  = {DoCoGen: Domain Counterfactual Generation for Low Resource Domain Adaptation},
  author = {Nitay Calderon and Eyal Ben-David and Amir Feder and Roi Reichart},
  journal= {arXiv preprint arXiv:2202.12350},
  year   = {2022}
}

备注

Our code and data are available at https://github.com/nitaytech/DoCoGen