面向视觉与语言任务的基于分组变换的轻量级 Transformer
计算机视觉与模式识别
2022-05-25 v1
摘要
尽管性能令人瞩目,Transformer 仍因其过多的参数与计算成本而受到诟病。然而,由于层设计(即多头注意力(MHA)与前馈网络(FFN))的内部复杂性,压缩 Transformer 仍是一个开放性问题。为解决此问题,我们引入分组变换(Group-wise Transformation)以构建一种通用且轻量级的、面向视觉与语言任务的 Transformer,称为 LW-Transformer。LW-Transformer 应用分组变换来减少 Transformer 的参数与计算量,同时保留其两个主要特性,即 MHA 在多样子空间上的高效注意力建模,以及 FFN 的扩展-缩放特征变换。我们将 LW-Transformer 应用于一组基于 Transformer 的网络,并在三个视觉与语言任务及六个基准数据集上对其进行定量评测。实验结果表明,在节省大量参数与计算量的同时,LW-Transformer 在视觉与语言任务上取得了与原版 Transformer 网络极具竞争力的性能。为检验泛化能力,我们还将该优化策略应用于近期提出的用于图像分类的图像 Transformer——Swin-Transformer,其有效性同样得到了验证。
引用
@article{arxiv.2204.07780,
title = {Towards Lightweight Transformer via Group-wise Transformation for Vision-and-Language Tasks},
author = {Gen Luo and Yiyi Zhou and Xiaoshuai Sun and Yan Wang and Liujuan Cao and Yongjian Wu and Feiyue Huang and Rongrong Ji},
journal= {arXiv preprint arXiv:2204.07780},
year = {2022}
}