图卷积丰富Transformer中的自注意力!
机器学习
2024-11-04 v5 人工智能
摘要
Transformer以其自注意力机制而闻名,在自然语言处理、计算机视觉、时间序列建模等各种任务中取得了最先进的性能。然而,深度Transformer模型面临的挑战之一是过度平滑问题,即各层的表示收敛到无法区分的值,导致性能显著下降。我们将原始自注意力解释为一个简单的图滤波器,并从图信号处理(GSP)的角度重新设计它。我们提出了一种基于图滤波器的自注意力(GFSA)来学习一个通用而有效的自注意力,其复杂度略大于原始自注意力机制。我们证明GFSA提高了Transformer在计算机视觉、自然语言处理、图级任务、语音识别和代码分类等多个领域的性能。
引用
@article{arxiv.2312.04234,
title = {Graph Convolutions Enrich the Self-Attention in Transformers!},
author = {Jeongwhan Choi and Hyowon Wi and Jayoung Kim and Yehjin Shin and Kookjin Lee and Nathaniel Trask and Noseong Park},
journal= {arXiv preprint arXiv:2312.04234},
year = {2024}
}
备注
Accepted to NeurIPS 2024. Jeongwhan Choi and Hyowon Wi are co-first authors with equal contributions