可核化注意力中的平移等变性
机器学习
2021-02-16 v1 计算机视觉与模式识别
摘要
尽管 Transformer 架构取得了显著成功,它们受限于计算所有输入元素两两交互,因而可扩展性有限。近期工作通过避免计算完整注意力矩阵取得成功,却给后续带来问题。显式注意力矩阵的缺失使得融入依赖元素间相对交互的归纳偏置更具挑战。一种极强的归纳偏置是平移等变性,其被认为对卷积神经网络在图像识别任务上的诸多成功负有责任。本工作中,我们展示如何在基于可核化注意力——Performer——的高效 Transformer 中实现平移等变性。我们的实验强调,相较朴素应用,所设计方法显著提升了 Performer 对输入图像平移的鲁棒性。这代表了以更具表达力的 Transformer 架构替代卷积神经网络道路上的重要一步,并将有助于提升该领域的样本效率与鲁棒性。
引用
@article{arxiv.2102.07680,
title = {Translational Equivariance in Kernelizable Attention},
author = {Max Horn and Kumar Shridhar and Elrich Groenewald and Philipp F. M. Baumann},
journal= {arXiv preprint arXiv:2102.07680},
year = {2021}
}