ReJump:用于分析与改进大语言模型推理的树跳表示
机器学习
2025-12-10 v2
摘要
大规模推理模型 (LRMs) 是专为生成长链思维 (CoTs) 而训练的大规模语言模型 (LLMs),在数学和编程等具有挑战性的任务上取得了显著成功。然而,这些模型的底层推理“算法”仍鲜有了解。为此,我们提出了 ReJump,将推理轨迹表示为对问题解决中间步骤树中节点访问顺序的记录。节点之间的转换,我们称为跳跃,包括捕获计算等行为的相邻移动,以及捕获回溯和验证等行为的非相邻移动。ReJump 使我们能够使用量化探索、利用、过度思考、遗忘和验证等多样化指标来分析 LLM 的推理。通过我们提出的 LLM 智能体提取推理轨迹至 ReJump 格式,我们在两个任务上评估了最先进的 LRMs,发现相似准确率的模型可能呈现不同的推理行为,而不同任务则偏好不同的推理风格(例如,探索与利用之间的不同平衡)。为进一步理解学习策略如何塑造推理,我们使用 ReJump 比较蒸馏 LRMs 与其教师、CoT 提示的 LLMs 与 LRMs,并检视推理示例数量和强化学习对推理行为的影响。最后,我们展示了 ReJump 能通过诸如 ReJump 指导的最佳-N 选择和提示选择等策略,在测试时提高推理质量。我们的代码已公开于 https://github.com/UW-Madison-Lee-Lab/ReJump。
引用
@article{arxiv.2512.00831,
title = {ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning},
author = {Yuchen Zeng and Shuibai Zhang and Wonjun Kang and Shutong Wu and Lynnix Zou and Ying Fan and Heeju Kim and Ziqian Lin and Jungtaek Kim and Hyung Il Koo and Dimitris Papailiopoulos and Kangwook Lee},
journal= {arXiv preprint arXiv:2512.00831},
year = {2025}
}