思维树能否解决 GitHub Issue?
软件工程
2024-05-24 v1 人工智能
摘要
尽管大语言模型(LLM)在代码生成方面已有广泛研究,如 HumanEval 等基准测试已达到令人瞩目的 96.3% 成功率,但这些基准主要评判模型在基础函数级代码生成上的表现,缺乏真实场景(如解决 GitHub Issue)所需的批判性思维和作用域概念。本研究引入思维树语言模型推理框架,以增强 LLM 在此类复杂任务中的决策与问题解决能力。与传统输入输出提示和检索增强生成技术相比,ToT 旨在通过对多条推理轨迹进行结构化探索并实现潜在解决方案的自我评估来提升性能。我们在 SWE-bench 实例中实验性地部署 ToT 以解决包含在内的 GitHub Issue。然而,我们的结果表明,仅靠 ToT 框架不足以赋予 LLM 超越现有方法的批判性推理能力。在本文中,我们分析了这些缺陷的潜在原因,并确定了关键改进领域,如深化思维过程和引入代理能力。本研究的见解旨在为完善 ToT 的应用及在真实问题解决场景中更好地利用 LLM 的潜力提供未来方向的参考。
关键词
引用
@article{arxiv.2405.13057,
title = {Can Github issues be solved with Tree Of Thoughts?},
author = {Ricardo La Rosa and Corey Hulse and Bangdi Liu},
journal= {arXiv preprint arXiv:2405.13057},
year = {2024}
}
备注
8 pages, 2 figures, 7 tables