具有可学习激活函数的 Transformer
计算与语言
2023-02-15 v3
摘要
激活函数可显著影响降低输入数据的拓扑复杂度,从而提升模型性能。选择合适的激活函数是神经模型设计的关键步骤。然而,基于 Transformer 的语言模型中 seldom 讨论或探索激活函数的选择。其激活函数事先选定,并从预训练到微调始终保持固定。结果,它们施加于模型的归纳偏置在此长生命周期中无法调整。此外,后续开发的模型(如 RoBERTa、BART 与 GPT-3)常沿用先前工作(如 BERT)使用相同激活函数而无论证。本文中,我们研究在 Transformer 架构中使用有理激活函数(RAF)——一种可学习激活函数——的有效性。与传统的预定义激活函数不同,RAF 可根据输入数据在训练中自适应学习最优激活函数。我们的实验表明,基于 RAF 的 Transformer(RAFT)比使用 GELU 函数的原始 BERT 达到更低的验证困惑度。我们进一步在低数据与全数据设定下于下游任务评估 RAFT。结果显示 RAFT 在多数任务与设定下优于对应模型。例如,RAFT 在低数据场景(可用100个训练样例)下于 GLUE 基准平均超越原始 BERT 5.71 分,并在全数据设定下于 SQuAD 超越 2.05 分。对所学 RAF 形状的分析进一步揭示,它们在预训练模型的不同层间差异显著,且大多与传统激活函数非常不同。RAFT 为依据所学激活函数分析与解释预训练模型开辟了新研究方向。
引用
@article{arxiv.2208.14111,
title = {Transformers with Learnable Activation Functions},
author = {Haishuo Fang and Ji-Ung Lee and Nafise Sadat Moosavi and Iryna Gurevych},
journal= {arXiv preprint arXiv:2208.14111},
year = {2023}
}
备注
Accepted by EACL2023 findings