GroupBERT:具有高效分组结构的增强型 Transformer 架构
计算与语言
2021-06-11 v1 机器学习
摘要
基于注意力的语言模型已成为最先进自然语言处理系统的关键组件。然而,这些模型由于长训练时间、密集运算和大量参数而具有显著的计算需求。在这项工作中,我们展示了一组对 Transformer 层结构的修改,产生了更高效的架构。首先,我们添加卷积模块以补充自注意力模块,解耦局部与全局交互的学习。其次,我们依赖分组变换来降低密集前馈层和卷积的计算成本,同时保持模型的表达能力。我们将所得架构应用于语言表示学习,并展示了其相较于不同规模的 BERT 模型的优越性能。我们进一步突出了其在浮点运算(FLOPs)和训练时间方面的效率提升。
引用
@article{arxiv.2106.05822,
title = {GroupBERT: Enhanced Transformer Architecture with Efficient Grouped Structures},
author = {Ivan Chelombiev and Daniel Justus and Douglas Orr and Anastasia Dietrich and Frithjof Gressmann and Alexandros Koliousis and Carlo Luschi},
journal= {arXiv preprint arXiv:2106.05822},
year = {2021}
}