基于蒙特卡罗树搜索树驱动的强化学习提升RepoQA-Agent
软件工程
2025-10-31 v1
摘要
仓库级别的软件工程任务需要大型语言模型(LLM)通过多轮工具交互高效地浏览和从复杂代码库中提取信息。现有方法面临显著局限性:训练无关、基于上下文学习的方法在利用工具和基于环境反馈进行决策方面难以有效引导,而训练有的方法通常依赖于来自更大LLM的高成本蒸馏,引入了企业环境中的数据合规性问题。为此,我们引入RepoSearch-R1,一种基于蒙特卡罗树搜索树(MCTS)驱动的agentic强化学习框架。该方法允许代理通过自我训练生成多样化的高质量推理轨迹,而无需模型蒸馏或外部监督。基于RepoSearch-R1,我们构建了一个专为仓库问答任务设计的RepoQA-Agent。针对仓库问答任务进行的全面评估显示,RepoSearch-R1在答案完整性方面实现了显著的改进:相对于无检索方法实现了16.0%的提升,相对于迭代检索方法实现了19.5%的改进,相对于通用agentic强化学习方法实现了33%的训练效率提升。我们的冷启动训练方法消除了数据合规性问题,同时在仓库级别推理任务中保持了稳健的探索多样性和答案完整性。
引用
@article{arxiv.2510.26287,
title = {Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search},
author = {Guochang Li and Yuchen Liu and Zhen Qin and Yunkun Wang and Jianping Zhong and Chen Zhi and Binhua Li and Fei Huang and Yongbin Li and Shuiguang Deng},
journal= {arXiv preprint arXiv:2510.26287},
year = {2025}
}