giMLP:MLP 中的门控与抑制机制
计算与语言
2022-08-03 v2
摘要
本文提出一种新模型架构——带抑制机制的门控 MLP(giMLP)。在 CycleMLP 上的门控与抑制(gi-CycleMLP)在 ImageNet 分类任务上可取得同等性能,并借助两项新技术改进 BERT、Roberta 与 DeBERTaV3 模型。其一是门控 MLP,通过 MLP 与主干 Attention 输入间的矩阵乘法进一步调整模型适配性。其二是抑制,用于抑制或增强分支调整,且随抑制水平提高,为模型提供更强的特征限制。我们表明低抑制水平的 giCycleMLP 在 ImageNet 分类精度上可与原始 CycleMLP 竞争。此外,综合实证研究表明这些技术显著提升 NLU 下游任务微调性能。对于 DeBERTa 上的门控与抑制 MLP(giDeBERTa)微调,我们发现其无需额外预训练即可在大多数 NLU 任务上取得引人瞩目的结果。我们还发现,使用门控与抑制时,激活函数应具备短而平滑的负尾,从而适度抑制不重要或损害模型的特征。在 ImageNet 与十二个语言下游任务上的实验证明了门控与抑制对图像分类及增强自然语言微调能力(无需额外预训练)的有效性。
引用
@article{arxiv.2208.00929,
title = {giMLPs: Gate with Inhibition Mechanism in MLPs},
author = {Cheng Kang and Jindich Prokop and Lei Tong and Huiyu Zhou and Yong Hu and Daneil Novak},
journal= {arXiv preprint arXiv:2208.00929},
year = {2022}
}
备注
It needs to be replaced in the future, because there are some extra experiments should be added