SWE Context Bench:用于编码情境学习的基准
机器学习
2026-02-10 v1 机器学习
摘要
大型语言模型日益被用作软件工程任务的编码代理。当前的基准主要评估代理是否能正确解决请求或修复错误。它们基本上将任务视为独立存在,不评估代理是否能够在相关问题之间复用先前的经验。因此,无法衡量利用先前经验所带来的效率提升。我们引入 SWE-ContextBench,这是一个旨在显式评估编码代理情境理解和检索的基准。SWE-ContextBench 由 1,100 个基础任务及从真实依赖和引用关系中从 GitHub issue 和 pull request 中派生的 376 个相关任务组成。SWE-ContextBench 将基础任务和相关任务在 51 个独特仓库和 9 种编程语言中按共享情境进行分组。基准评估当先前案例可用于情境中的代理如何准确且有效地解决相关问题。使用 SWE-ContextBench,我们研究了多个编码代理在不同情境复用设置和检索策略下的行为。我们的结果表明,准确总结和检索先前经验可显著提高解决准确率,同时缩短运行时间和 token 成本,尤其是在更难的任务上。相比之下,未经筛选或错误选择的情境仅能提供有限或负面的益处。这些发现凸显了情境管理和检索准确性的重要性,并将 SWE-ContextBench 定位为研究编码代理情境学习的原则性基准。
引用
@article{arxiv.2602.08315,
title = {Fast Flow Matching based Conditional Independence Tests for Causal Discovery},
author = {Shunyu Zhao and Yanfeng Yang and Shuai Li and Kenji Fukumizu},
journal= {arXiv preprint arXiv:2602.08315},
year = {2026}
}