Jupiter:通过笔记本和推理时间价值导向搜索提升 LLM 数据分析能力
人工智能
2025-12-04 v2
摘要
大语言模型(LLM)在自动化数据科学工作流程方面显示出巨大的潜力,但现有模型在多步骤推理和工具使用方面仍存在挑战,这限制了其在复杂数据分析任务中的有效性。为此,我们提出了一个可扩展管道,从真实世界的 Jupyter 笔记本及其关联数据文件中提取高质量、基于工具的数据分析任务及其可执行多步骤解决方案。使用该管道,我们引入 NbQA,一个大规模标准化任务-解决方案数据集,反映真实世界数据科学场景中的工具使用模式。为进一步增强多步骤推理,我们提出了 Jupiter 框架,将数据分析建模为搜索问题,并应用蒙特卡洛树搜索(MCTS)生成多样化的解决方案轨迹以进行价值模型学习。在推理期间,Jupiter 结合价值模型和节点访问计数,高效收集可执行的多步骤计划,所需搜索步骤最少。实验结果表明,Qwen2.5-7B 和 14B-Instruct 模型在 InfiAgent-DABench 上的任务解决率分别为 77.82% 和 86.38%,与 GPT-4o 及先进的智能体框架相当或更好。进一步的评估显示,其在 diverse 多步骤推理任务上的泛化能力和工具使用推理能力得到提高。代码和数据已公开于 https://github.com/microsoft/Jupiter。
关键词
引用
@article{arxiv.2509.09245,
title = {Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search},
author = {Shuocheng Li and Yihao Liu and Silin Du and Wenxuan Zeng and Zhe Xu and Mengyu Zhou and Yeye He and Haoyu Dong and Shi Han and Dongmei Zhang},
journal= {arXiv preprint arXiv:2509.09245},
year = {2025}
}
备注
Accepted to AAAI 2026 (Main Technical Track)