中文

基于存储库结构的训练提升小型语言模型的 Issue 解决能力

软件工程 2024-12-30 v1 人工智能

摘要

语言模型已被应用于 various software development tasks,但性能随模型规模而异。大型语言模型(LLMs)在类似存储库级别的 issue 解决等复杂任务中表现优于小型语言模型(SLMs),但引发隐私和成本的担忧。相比之下,SLMs 更易于获取,但在复杂任务中表现不足。本文引入 ReSAT(Repository Structure-Aware Training),基于开源社区中大量 issue 及其对应 pull request 构建训练数据,以增强模型对存储库结构和 issue 解决能力的理解。我们构建两种训练数据:(1)局部化训练数据,一种多层次渐进式局部化数据,用于提高代码理解和局部化能力;(2)代码编辑训练数据,用于提高基于上下文的代码编辑能力。在 SWE-Bench-verified 和 RepoQA 上的评估结果表明,ReSAT 有效提升了 SLMs 的 issue 解决和存储库级别长上下文理解能力。

关键词

引用

@article{arxiv.2412.19031,
  title  = {Repository Structure-Aware Training Makes SLMs Better Issue Resolver},
  author = {Zexiong Ma and Shengnan An and Zeqi Lin and Yanzhen Zou and Bing Xie},
  journal= {arXiv preprint arXiv:2412.19031},
  year   = {2024}
}