面向高效 Transformer 及其之外的神经架构搜索
计算与语言
2022-07-29 v1
摘要
近年来,为降低标准 Transformer 因 Softmax 注意力引起的二次计算复杂度,人们提出了众多高效 Transformer。然而,它们大多仅将 Softmax 替换为高效注意力机制,而未考虑针对高效注意力定制的架构。本文认为,为 Softmax 注意力手工设计的朴素 Transformer 架构可能并不适用于高效 Transformer。为解决此问题,我们提出了一种新框架,利用神经架构搜索(NAS)技术为高效 Transformer 寻找最优架构。所提方法在流行的机器翻译和图像分类任务上得到验证。我们观察到,高效 Transformer 的最优架构相比标准 Transformer 计算量有所降低,但总体精度较逊。这表明 Softmax 注意力与高效注意力各有特点,但均无法同时很好地平衡精度与效率。这促使我们混合两类注意力以缓解性能失衡。除现有 NAS Transformer 方法中常用的搜索空间外,我们提出了一种新搜索空间,使 NAS 算法能随架构自动搜索注意力变体。在 WMT'14 En-De 和 CIFAR-10 上的大量实验表明,我们搜索出的架构在保持与标准 Transformer 相当精度的同时,计算效率显著提升。
引用
@article{arxiv.2207.13955,
title = {Neural Architecture Search on Efficient Transformers and Beyond},
author = {Zexiang Liu and Dong Li and Kaiyue Lu and Zhen Qin and Weixuan Sun and Jiacheng Xu and Yiran Zhong},
journal= {arXiv preprint arXiv:2207.13955},
year = {2022}
}