中文

互斥性训练与基元增强以诱导组合性

计算与语言 2022-11-29 v1 人工智能 机器学习

摘要

近期的数据集揭示了标准序列到序列模型缺乏系统性泛化能力。在本工作中,我们分析了 seq2seq 模型的这一行为,并确定了两个促成因素:缺乏互斥性偏置(即,已映射到某个目标序列的源序列不太可能再映射到其他目标序列),以及倾向于记忆整个样本而非将结构与内容分离。我们分别提出两种技术来解决这两个问题:互斥性训练,通过基于似然损失的机制防止模型在面对新颖、未见过的样本时生成已见过的结果;以及 prim2primX 数据增强,自动多样化每个语法函数的参数以防止记忆,并在不暴露测试集数据的情况下提供组合归纳偏置。通过结合这两种技术,我们在两个广泛使用的组合性数据集 SCAN 和 COGS 上,使用标准序列到序列模型(LSTM 和 Transformer)展示了显著的实证改进。最后,我们提供了表征这些改进及剩余挑战的分析,并对我们的方法进行了详细的消融实验。我们的代码可在 https://github.com/owenzx/met-primaug 获取。

关键词

引用

@article{arxiv.2211.15578,
  title  = {Mutual Exclusivity Training and Primitive Augmentation to Induce Compositionality},
  author = {Yichen Jiang and Xiang Zhou and Mohit Bansal},
  journal= {arXiv preprint arXiv:2211.15578},
  year   = {2022}
}

备注

EMNLP 2022 (16 pages; the first 2 authors contributed equally)