中文

AutoTrans:通过强化架构搜索实现 Transformer 设计的自动化

计算与语言 2021-06-01 v2

摘要

尽管 transformer 架构在许多自然语言理解任务中已占据主导地位,但 transformer 模型训练仍存在未解决的问题,尤其是缺乏有原则的预热方式(已被证明对 transformer 的稳定训练十分重要),以及当前任务是否倾向于对注意力乘积进行缩放。本文从经验上探索 transformer 模型中设计选择的自动化,即如何设置层归一化、是否缩放、层数、头数、激活函数等,从而得到一个更契合手头任务的 transformer 架构。我们采用强化学习(RL)在搜索空间中导航,并设计特殊的参数共享策略以加速搜索。研究表明,在搜索时每轮采样一定比例的训练数据有助于提高搜索质量。在 CoNLL03、Multi-30k、IWSLT14 和 WMT-14 上的实验表明,搜索得到的 transformer 模型优于标准 transformer。特别地,我们展示了所学模型可在不使用预热的情况下以较大学习率更鲁棒地训练。

关键词

引用

@article{arxiv.2009.02070,
  title  = {AutoTrans: Automating Transformer Design via Reinforced Architecture Search},
  author = {Wei Zhu and Xiaoling Wang and Xipeng Qiu and Yuan Ni and Guotong Xie},
  journal= {arXiv preprint arXiv:2009.02070},
  year   = {2021}
}

备注

will add new technical contents