中文

G1:通过强化学习教授 LLMs 进行图 reasoning

机器学习 2025-08-20 v3 人工智能 机器学习

摘要

尽管大型语言模型(Large Language Models, LLMs)在各类任务中展现出卓越进展,但其在图相关任务上的专业能力仍有限,阻碍了构建通用模型。以往尝试,包括预训练图形基础模型或采用监督微调,往往面临大规模、通用表示图数据稀缺等挑战。我们引入 G1,一种简单而有效的方法,表明在合成图论任务上进行强化学习(Reinforcement Learning, RL)可显著提升 LLMs 的图 reasoning 能力。为实现 RL 训练,我们构建了 Erd\~os 数据集,目前规模最大的图 reasoning 数据集,包含 50 种不同难度的图论任务,分别拥有 10 万训练样本和 5 千测试样本,全部源自真实世界图。通过在 Erd\~os 上进行 RL 训练,G1 在图 reasoning 方面实现了显著提升,其中我们微调的 3B 模型甚至超越了 Qwen2.5-72B-Instruct(规模是其 24 倍)。RL 训练的模型在零样本 generalization 上也表现出强劲能力,能够无需额外微调地应用于未见任务、领域及图编码方案,包括其他图论基准以及真实世界的节点分类和链路预测任务,同时不损失常规推理能力。我们的发现为通过在图论任务上进行 RL 微调 LLMs 以构建强大图 reasoner 提供了高效、可扩展的路径,这将 pretrained LLM 能力与丰富的自动生成合成数据相结合,表明 LLMs 具备 RL 能成功唤醒的图理解能力。我们的实现已开源于 https://github.com/PKU-ML/G1,模型和数据集托管于 Hugging Face collections https://huggingface.co/collections/PKU-ML/g1-683d659e992794fc99618cf2,便于更广泛的访问。

关键词

引用

@article{arxiv.2505.18499,
  title  = {G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning},
  author = {Xiaojun Guo and Ang Li and Yifei Wang and Stefanie Jegelka and Yisen Wang},
  journal= {arXiv preprint arXiv:2505.18499},
  year   = {2025}
}