中文

将 Transformer 转换为有向图神经网络形式

机器学习 2025-03-05 v3 计算与语言

摘要

深度学习的最新进展已将 Transformer 架构确立为主导的建模范式。Transformer 成功的核心是自注意力机制,它通过计算查询矩阵与键矩阵之间的相似度来调制值矩阵。此操作与有向图卷积具有惊人的相似性,这促使我们研究有向图卷积是否可以作为自注意力的替代方案。在本研究中,我们通过引入基于有向图傅里叶变换的合成酉有向图卷积,将此概念形式化。由此产生的模型,我们称之为 Converter,有效地将 Transformer 转换为有向图神经网络 (DGNN) 形式。我们在 Long-Range Arena 基准测试、长文档分类和基于 DNA 序列的分类学分类上测试了 Converter。实验结果表明,Converter 在保持计算效率和架构简洁性的同时,实现了卓越的性能,这使其成为一种轻量级但强大的 Transformer 变体。

关键词

引用

@article{arxiv.2502.00585,
  title  = {Converting Transformers into DGNNs Form},
  author = {Jie Zhang and Mao-Hsuan Mao and Bo-Wei Chiu and Min-Te Sun},
  journal= {arXiv preprint arXiv:2502.00585},
  year   = {2025}
}

备注

21 pages, 3 figures, and 8 tables; pseudocode improved