LambdaNetworks:无需注意力的长程交互建模
计算机视觉与模式识别
2021-02-18 v1 机器学习
摘要
我们提出 lambda 层——一种替代自注意力(self-attention)的框架——用于捕捉输入与结构化上下文信息(例如被其他像素包围的像素)之间的长程交互。Lambda 层通过将可用上下文转换为称为 lambda 的线性函数,并分别将这些线性函数应用于每个输入,从而捕捉此类交互。与线性注意力类似,lambda 层避开了昂贵的注意力图,但不同的是,它们对基于内容和基于位置的交互都进行建模,这使得它们可应用于图像等大型结构化输入。由此得到的神经网络架构 LambdaNetworks 在 ImageNet 分类、COCO 目标检测和 COCO 实例分割上显著优于其卷积与注意力对应方法,同时计算效率更高。此外,我们设计了 LambdaResNets,一系列跨不同尺度的混合架构,大幅改善了图像分类模型的速度-精度权衡。LambdaResNets 在 ImageNet 上达到优异精度,同时在现代机器学习加速器上比流行的 EfficientNets 快 3.2–4.4 倍。当使用额外的 1.3 亿张伪标注图像进行训练时,LambdaResNets 相比相应的 EfficientNet 检查点实现了高达 9.5 倍加速。
引用
@article{arxiv.2102.08602,
title = {LambdaNetworks: Modeling Long-Range Interactions Without Attention},
author = {Irwan Bello},
journal= {arXiv preprint arXiv:2102.08602},
year = {2021}
}
备注
Accepted for publication at the International Conference in Learning Representations 2021 (Spotlight)