中文

利用中间表示释放预训练模型中的组合泛化能力

计算与语言 2021-04-16 v1

摘要

序列到序列(seq2seq)模型在语义解析中十分普遍,但已被发现难以应对分布外组合泛化。尽管已有专门提出的模型架构和seq2seq模型的预训练来解决此问题,但前者常以牺牲通用性为代价,而后者仅表现出有限的效果。在本文中,我们研究了中间表示对预训练seq2seq模型中组合泛化的影响,完全不改变模型架构,并确定了设计有效表示的关键方面。我们不是训练模型直接将自然语言映射到可执行形式,而是映射到一个与自然语言具有更强结构对应关系的可逆或有损中间表示。我们提出的中间表示与预训练模型的结合出奇地有效,其中最佳组合在CFQ上取得了新的最先进水平(+14.8个准确率点),并在三个文本到SQL数据集的模板切分上取得了新的最先进水平(+15.0到+19.4个准确率点)。本工作强调,中间表示为提升预训练seq2seq模型的组合泛化能力提供了一个重要且可能被忽视的自由度。

关键词

引用

@article{arxiv.2104.07478,
  title  = {Unlocking Compositional Generalization in Pre-trained Models Using Intermediate Representations},
  author = {Jonathan Herzig and Peter Shaw and Ming-Wei Chang and Kelvin Guu and Panupong Pasupat and Yuan Zhang},
  journal= {arXiv preprint arXiv:2104.07478},
  year   = {2021}
}