Tree-of-Code:面向复杂任务的端到端代码生成与执行的树状探索框架
摘要
解决复杂推理任务是智能体的关键现实世界应用。得益于大型语言模型(LLM)在代码数据上的预训练,CodeAct 等近期方法成功地将代码作为 LLM 智能体的动作,取得了良好成果。然而,CodeAct 依赖碎片化思考生成下一个动作的代码块,导致一致性和稳定性不足。此外,CodeAct lacks 行动相关的真实答案(GT),使得其在多轮交互中的监督信号和终止条件存疑。为此,我们首先引入一种简单而有效的端到端代码生成范式——CodeProgram,利用代码的系统逻辑与全局推理一致,实现协调的问题解决。随后,我们提出 Tree-of-Code(ToC),该框架根据代码的可执行性自生长 CodeProgram 节点,在无 GT 的场景下实现自监督。实验在两个数据集上使用十个流行的零-shot LLM 显示,ToC 在 CodeAct 上的准确率提升约 20%,且轮次不足其 1/4。甚至有多个 LLM 在单轮 CodeProgram 上表现优于多轮 CodeAct。为进一步探讨有效性与效率之间的权衡,我们测试了不同的 ToC 树规模和探索机制。我们还强调 ToC 端到端数据生成在监督和强化微调方面的潜力。
引用
@article{arxiv.2412.15305,
title = {Tree-of-Code: A Tree-Structured Exploring Framework for End-to-End Code Generation and Execution in Complex Task Handling},
author = {Ziyi Ni and Yifan Li and Ning Yang and Dou Shen and Pin Lv and Daxiang Dong},
journal= {arXiv preprint arXiv:2412.15305},
year = {2025}
}
备注
This idea was first submitted to the NeuralPS Workshop "System 2 Reasoning At Scale" in September 2024. Its OpenReview: https://openreview.net/forum?id=8NKAL8Ngxk¬eId=8NKAL8Ngxk. It was then submitted to the NAACL 2025 in October 2024, which is recorded in: https://openreview.net/forum?id=S0ZUWD3Vy5¬eId=S0ZUWD3Vy5. Now this paper has been accepted for publication in ACL 2025 Findings