中文

VulRTex:基于推理引导的从丰富文本问题报告中识别漏洞的方法

软件工程 2025-09-05 v1

摘要

软件漏洞存在于开源软件(OSS)中,发现这些漏洞的开发者可能提交问题报告(issue reports, IRs)以描述其细节。安全从业者需要大量时间手动识别社区中与漏洞相关的 IRs,而时间差可能被攻击者利用以损害系统。此前的研究提出了自动化方法来促进识别这些漏洞相关的 IRs,但这些工作仅关注文本描述,缺乏对 IR 丰富文本信息的全面分析。本文提出了 VulRTex,一种利用丰富文本信息识别漏洞相关 IRs 的推理引导方法。具体而言,VulRTex 首先利用大语言模型(Large Language Model, LLM)的推理能力,构建包含历史 IRs 的漏洞推理数据库。随后检索相关案例以生成推理指导,指导 LLM 对目标 IRs 的丰富文本信息进行推理分析以识别漏洞。为评估 VulRTex 的性能,我们在 973,572 条 IRs 上开展实验,结果表明在数据不平衡情况下,VulRTex 在识别漏洞相关 IRs 和预测 CWE-ID 方面性能最佳,相较于最佳基线提升了 +11.0% F1、+20.2% AUPRC、+10.5% Macro-F1,且耗时比基线推理方法低 2 倍。此外,VulRTex 已被用于识别 2024 年 GitHub IRs 中 10 个有代表性的 OSS 项目中的 30 个新兴漏洞,其中 11 个成功获得 CVE 编号,说明 VulRTex 具有实际应用价值。

关键词

引用

@article{arxiv.2509.03875,
  title  = {VulRTex: A Reasoning-Guided Approach to Identify Vulnerabilities from Rich-Text Issue Report},
  author = {Ziyou Jiang and Mingyang Li and Guowei Yang and Lin Shi and Qing Wang},
  journal= {arXiv preprint arXiv:2509.03875},
  year   = {2025}
}

备注

25 pages, 7 figures, submitting to TOSEM journal