TGPR:面向 LLM 自调试的基于树导向的策略细化
人工智能
2025-10-09 v1
摘要
迭代细化是启用大型语言模型 (LLM) 解决困难推理和问题解决任务的有前景的方法之一。然而,关键挑战在于如何有效地搜索可能的细化路径庞大的搜索空间。现有方法通常依赖预定义的启发式方法,这些方法受探索-开发平衡问题困扰,无法根据过去的细化结果进行自适应。我们引入基于树导向的策略细化 (TGPR),一种新型框架,将 GRPO 与基于 Thompson 抽样的树搜索结合。TGPR 积极地探索失败和成功的细化路径,采用更密集的训练轨迹和更自适应的策略。在 HumanEval、MBPP 和 APPS 基准测试上,我们的方法在 MBPP 上的 pass@1 提升最高可达 +4.2 个百分点,在 APPS 上的 pass@10 提升最高可达 +12.51 个百分点,相对于具有竞争力的 GRPO 基线。除了调试代码外,TGPR 关注一种原则方法,将学习策略与结构化搜索方法相结合,为增强迭代细化和有状态推理提供了通用框架。
引用
@article{arxiv.2510.06878,
title = {TGPR: Tree-Guided Policy Refinement for Robust Self-Debugging of LLMs},
author = {Daria Ozerova and Ekaterina Trofimova},
journal= {arXiv preprint arXiv:2510.06878},
year = {2025}
}