中文

LLMBisect:通过比较分析管道突破 bug bisection 的障碍

机器学习 2025-10-31 v1

摘要

Bug bisection 是一个重要的安全任务,旨在理解由 bug 影响的软件版本范围,即识别引入 bug 的 commit。然而,传统的基于补丁的 bisection 方法面临若干重大障碍:例如,它们假设 bug 引起的 commit (BIC) 与补丁 commit 修改相同的函数,这并不总是成立。它们常仅依赖代码变更,而 commit message 经常包含丰富的漏洞相关信息。它们还基于简单启发式(例如假设 BIC 初始化补丁中删除的行),缺乏对漏洞的逻辑分析。在本文中,我们观察到大型语言模型 (LLM) 已然处于打破现有解决方案障碍的优势位置,例如理解补丁和 commit 中的文本与代码。不同于以往的 BIC 识别方法,我们提出了一个综合性的多阶段管道,利用 LLM 实现:(1)充分利用补丁信息,(2)对多个候选 commit 进行上下文比较,(3)通过一系列下选步骤逐步缩小候选范围。在我们的评估中,我们展示了该方法相较于最先进的解决方案实现了超过 38% 的显著性更好准确率。我们的结果进一步确认,综合性的多阶段管道至关重要,因为其将准确率提高了 60%。

关键词

引用

@article{arxiv.2510.26086,
  title  = {LLMBisect: Breaking Barriers in Bug Bisection with A Comparative Analysis Pipeline},
  author = {Zheng Zhang and Haonan Li and Xingyu Li and Hang Zhang and Zhiyun Qian},
  journal= {arXiv preprint arXiv:2510.26086},
  year   = {2025}
}