图内存变换器(GMT)
摘要
我们探讨了在解码器-only 变换器中替换前馈网络(FFN)子层是否可以通过显式学习的记忆图来保持周围的自回归架构。提出的图内存变换器(Graph Memory Transformer,GMT)保持因果自注意力不变,但将常规的 per-token FFN 变换替换为一个记忆细胞,该细胞通过在由学习的质心库组成的记忆中路由 token 表示,质心之间由学习的有向转移矩阵相连。在本文所研究的 base GMT v7 实现中,每个 transformer 块包含 128 个质心、128×128 的边矩阵、引力源路由、token 条件目标选择以及门控位移读取器。该细胞因此返回从估计的源记忆状态向目标记忆状态的位移,而非检索值。 resulting model 是一个完全 decoder-only 的语言模型,拥有 8220 万可训练参数,无稠密 FFN 子层,与用于评估的 1030 万参数稠密 GPT 风格基线相比较。base v7 模型能够稳定训练,并将质心使用情况、转移结构以及源向目标位移作为前向计算中可直接检查的量公开。它在验证损失和 perplexity 上仍落后于更大的稠密基线(分别为 3.5995/36.58 vs. 3.2903/26.85),但在所评估的设置下表现出接近的零样本基准行为。这些结果不旨作为最先进技术的宣称;它们支持用图中介记忆导航取代稠密 within-token 转换的可行性和结构可解释性。更广泛的规模化、优化的内核以及更广泛的基准评估留待后续工作。
引用
@article{arxiv.2604.23862,
title = {Graph Memory Transformer (GMT)},
author = {Nicola Zanarini and Niccolò Ferrari and Evelina Lamma},
journal= {arXiv preprint arXiv:2604.23862},
year = {2026}
}
备注
65 pages, 10 figures, 5 tables. Author list updated in arXiv metadata; no technical changes. Code available at https://github.com/Nemesis533/GMT-GraphMemoryTransformer