中文

在视觉Transformer中以ReLU替换softmax

计算机视觉与模式识别 2023-10-18 v2 机器学习

摘要

先前的研究观察到,将注意力中的 softmax 替换为 ReLU 等逐点激活时会出现精度下降。在视觉 transformer 的背景下,我们发现当除以序列长度时,这种下降会得到缓解。我们在 ImageNet-21k 上训练从小型到大型的视觉 transformer 的实验表明,就作为计算量的函数的扩展行为而言,ReLU 注意力可以接近或匹配 softmax 注意力的性能。

关键词

引用

@article{arxiv.2309.08586,
  title  = {Replacing softmax with ReLU in Vision Transformers},
  author = {Mitchell Wortsman and Jaehoon Lee and Justin Gilmer and Simon Kornblith},
  journal= {arXiv preprint arXiv:2309.08586},
  year   = {2023}
}