图感知同构注意力:Transformer 中的自适应动力学
机器学习
2025-03-06 v3 介观与纳米尺度物理
材料科学
人工智能
计算与语言
摘要
我们提出了一种修改 Transformer 架构的方法,通过将图感知关系推理集成到注意力机制中,融合了图神经网络和语言建模的概念。基于注意力与图论之间的内在联系,我们将 Transformer 的注意力机制重新表述为图操作,并提出了图感知同构注意力。该方法利用先进的图建模策略,包括图同构网络 (GIN) 和主邻域聚合 (PNA),来丰富关系结构的表示。我们的方法能够捕捉复杂的依赖关系并跨任务泛化,这体现在泛化差距的减小和学习性能的提升上。此外,我们扩展了图感知注意力的概念,引入了稀疏 GIN-Attention,这是一种采用稀疏 GIN 的微调方法。通过将注意力矩阵解释为稀疏邻接图,该技术以最小的计算开销增强了预训练基础模型的适应性,使其具备图感知能力。与低秩适应 (LoRA) 等替代方法相比,稀疏 GIN-Attention 微调实现了更好的训练动态和泛化性能。我们讨论了传统注意力机制中潜在的类图结构,为理解 Transformer 提供了新的视角,并将 Transformer 演化为用于关系推理的层次化 GIN 模型。这一观点对基础模型开发具有深远意义,使得能够设计动态适应局部和全局依赖的架构。在生物信息学、材料科学、语言建模等领域的应用将受益于这种关系数据与序列数据的融合建模,为可解释且可泛化的建模策略奠定了基础。
引用
@article{arxiv.2501.02393,
title = {Graph-Aware Isomorphic Attention for Adaptive Dynamics in Transformers},
author = {Markus J. Buehler},
journal= {arXiv preprint arXiv:2501.02393},
year = {2025}
}