中文

Transformer能学习某些图的连通性但不能学习其他图

计算与语言 2026-04-23 v2 人工智能 机器学习 计算机科学中的逻辑

摘要

推理能力对于确保基于Transformer的大语言模型(LLM)响应的事实正确性至关重要,而对传递关系的鲁棒推理在因果推断等许多场景中起着重要作用。因此,研究Transformer在推断传递关系任务(例如,知道A导致B且B导致C,则A导致C)中的能力至关重要。推断传递关系的任务等价于有向图中的连通性任务(例如,知道存在从A到B的路径,且存在从B到C的路径,则存在从A到C的路径)。以往的研究关注Transformer是否能从输入提示中提供的上下文示例学习推断传递性。然而,Transformer从训练示例中推断传递关系的能力以及缩放如何影响该能力尚未被探索。在本研究中,我们通过生成有向图来训练不同规模的Transformer模型,并评估它们对各种规模图的传递关系推断能力,以回答这一问题。我们的发现表明,Transformer能够在“网格状”有向图上学习连通性,其中每个节点可以嵌入到低维子空间中,且连通性易于从节点的嵌入中推断。我们发现底层网格图的维度是Transformer学习连通性任务能力的强预测因子,高维网格图比低维网格图构成更大的挑战。此外,我们观察到增大模型规模会带来对网格图连通性推断越来越好的泛化能力。然而,如果图不是网格图且包含许多不连通的组件,Transformer则难以学习连通性任务,尤其是当组件数量很大时。

关键词

引用

@article{arxiv.2509.22343,
  title  = {Transformers Can Learn Connectivity in Some Graphs but Not Others},
  author = {Amit Roy and Abulhair Saparov},
  journal= {arXiv preprint arXiv:2509.22343},
  year   = {2026}
}

备注

This paper contains some assumption which is not correct