中文

大型语言模型是否为图算法推理者?

机器学习 2024-10-31 v1 人工智能

摘要

我们致力于解决当前大型语言模型(LLM)面临的核心挑战。尽管 LLM 在许多任务中表现卓越,但仍在处理需要多步骤推理的显式图问题时困难。为此,我们引入了一个 novel benchmark,用于评估 LLM 在显式图上的经典算法推理任务中的性能。该基准涵盖五种基本算法:用于连通性的广度优先搜索(BFS)和深度优先搜索(DFS),用于计算所有节点最短路径的 Dijkstra 算法和 Floyd-Warshall 算法,以及 Prim's 最小生成树(MST-Prim's)算法。通过大规模实验,我们系统评估了最先进 LLM 在执行这些算法各个阶段的能力。我们的发现突显了 LLM 在该领域持续的挑战,凸显了针对图形推理能力提升而需要的高级提示技术和算法指令的必要性。这项工作提出了 MAGMA,即首个专注于 LLM 完成经典图算法的综合基准,并为理解和改进其结构化问题解决技能提供了关键一步。

关键词

引用

@article{arxiv.2410.22597,
  title  = {Are Large-Language Models Graph Algorithmic Reasoners?},
  author = {Alexander K Taylor and Anthony Cuturrufo and Vishal Yathish and Mingyu Derek Ma and Wei Wang},
  journal= {arXiv preprint arXiv:2410.22597},
  year   = {2024}
}

备注

9 pages, 13 Figures