中文

变形器在学习搜索方面存在困难

计算与语言 2025-03-18 v2 人工智能 机器学习

摘要

搜索是许多重要任务中基础且重要的能力,近期研究表明大型语言模型(LLM)在进行稳健搜索方面存在困难。究其原因,可能是数据不足、模型参数不够,或是变形器架构的根本局限。本文我们以图的连通性问题为测试基准,生成大量高覆盖率数据以训练小型变形器,从而测试其是否能够学习执行搜索。我们发现,在给定恰当的训练分布时,变形器能够学习执行搜索。我们通过一种新颖的机制可解释性技术分析了变形器所学习的算法,以提取模型中的计算图。我们发现变形器在每个顶点并行执行搜索:对于输入图中的每个顶点,变形器计算从该顶点可到达的顶点集合。每个层随后依次扩大这些集合,使模型能够搜索数量为 nlayersn_{\text{layers}} 的指数级顶点。然而,我们发现随着输入图的大小增加,变形器在学习该任务方面的困难性加大。即使增加模型参数,此困难仍未得到解决,这表明增加模型规模不会导致稳健的搜索能力。我们也发现,在更大图上进行链式思维(即 in-context)并不能解决学习搜索的困难。

关键词

引用

@article{arxiv.2412.04703,
  title  = {Transformers Struggle to Learn to Search},
  author = {Abulhair Saparov and Srushti Pawar and Shreyas Pimpalgaonkar and Nitish Joshi and Richard Yuanzhe Pang and Vishakh Padmakumar and Seyed Mehran Kazemi and Najoung Kim and He He},
  journal= {arXiv preprint arXiv:2412.04703},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025