中心化自注意力层
机器学习
2023-06-05 v1
摘要
Transformer中的自注意力机制与图神经网络中的消息传递机制在深度学习架构中被反复使用。我们表明,这种使用不可避免地导致过平滑,即Transformer中不同token与图神经网络中不同节点在更深层具有相似的表示。基于我们的分析,我们给出了这些机制的聚合算子的一个修正项。经验上,这一简单项消除了视觉Transformer中大部分的过平滑问题,在弱监督分割中取得了超越引入多个辅助网络与训练阶段的精细基线方法的性能。在图神经网络中,该修正项比许多近期针对同一问题的方案更有效地支持了极深架构的训练。
引用
@article{arxiv.2306.01610,
title = {Centered Self-Attention Layers},
author = {Ameen Ali and Tomer Galanti and Lior Wolf},
journal= {arXiv preprint arXiv:2306.01610},
year = {2023}
}