中文

变形器在图连通性方面可证学习算法解决方案,但仅限于正确的数据

机器学习 2026-02-19 v2

摘要

变形器往往难以学习可泛化的算法,倾向于依赖脆弱的启发式方法。我们以图连通性为测试基准,理论和实证地解释了这一现象。我们考虑了一个简化的变形器架构——解�排变形器。我们证明,LL 层的模型可以在直径最多为 3L3^L 的图上计算连通性,实现等效于计算邻接矩阵幂的数值算法。通过分析训练动力学,我们证明,是否学习到这一策略取决于大多数训练实例是否在此模型容量范围内。在容量范围内的图(直径 3L\leq 3^L)驱动算法解决方案的学习,而超出容量范围的图驱动基于节点度数的简单启发式方法的学习。最后,我们实证表明,将训练数据限制在模型容量范围内后,标准变形器和解�排变形器都能学习到确切的算法。

关键词

引用

@article{arxiv.2510.19753,
  title  = {Transformers Provably Learn Algorithmic Solutions for Graph Connectivity, But Only with the Right Data},
  author = {Qilin Ye and Deqing Fu and Robin Jia and Vatsal Sharan},
  journal= {arXiv preprint arXiv:2510.19753},
  year   = {2026}
}