中文

细节决定成败:简单技巧提升Transformer的系统泛化能力

机器学习 2022-02-15 v4 人工智能 神经与进化计算

摘要

近来,许多数据集被提出用于测试神经网络的系统泛化能力。相应的基线Transformer通常使用标准任务的默认超参数训练,被证明会惨败。本文中我们展示,通过重新审视诸如嵌入缩放、早停、相对位置嵌入和Universal Transformer变体等基础的模型配置,我们可以大幅提升Transformer在系统泛化上的表现。我们报告了在五个流行数据集上的改进:SCAN、CFQ、PCFG、COGS和Mathematics数据集。我们的模型在PCFG生成力切分上准确率从50%提升到85%,在COGS上从35%提升到81%。在SCAN上,相对位置嵌入大幅缓解了EOS决策问题(Newman等人,2020),在长度切分(截断于26)上取得100%准确率。重要的是,这些模型间的性能差异在IID数据切分上通常不可见。这呼吁为开发具备系统泛化能力的神经网络建立恰当的泛化验证集。我们公开发布代码以复现结果。

关键词

引用

@article{arxiv.2108.12284,
  title  = {The Devil is in the Detail: Simple Tricks Improve Systematic Generalization of Transformers},
  author = {Róbert Csordás and Kazuki Irie and Jürgen Schmidhuber},
  journal= {arXiv preprint arXiv:2108.12284},
  year   = {2022}
}

备注

Accepted to EMNLP 2021