中文

GraphArena:在图计算任务上评估和探索大型语言模型

人工智能 2025-02-18 v2 计算与语言

摘要

大型语言模型(LLM)的"军备竞赛"迫切需要新的基准来检验其进展。本文我们介绍GraphArena,一个设计用于评估LLM在真实世界图计算问题上表现的基准工具。GraphArena提供四个多项时算法题(例如最短距离)和六个NP完全问题(例如旅行商问题)的任务。GraphArena具备严格的评估框架,将LLM输出分类为正确、次优(可行但非最优)、幻觉(格式正确但不可行)或缺失。对10多款LLM的评估显示,即便是表现最好的LLM在处理更大规模、更复杂的图问题时也难以为继,并表现出幻觉问题。我们进一步探讨了四种潜在解决方案以解决此问题并提高LLM在图计算方面的能力,包括链式思考提示、指令调优、代码编写和扩大推理计算资源,每种方法都展示了独特的优势和局限。GraphArena补充了现有的LLM基准测试工具,并已开源于https://github.com/squareRoot3/GraphArena。

关键词

引用

@article{arxiv.2407.00379,
  title  = {GraphArena: Evaluating and Exploring Large Language Models on Graph Computation},
  author = {Jianheng Tang and Qifan Zhang and Yuhan Li and Nuo Chen and Jia Li},
  journal= {arXiv preprint arXiv:2407.00379},
  year   = {2025}
}

备注

ICLR 2025 camera ready version