中文

从审稿人视角:使用大语言模型理解漏洞报告无效原因

软件工程 2025-11-25 v1 密码学与安全

摘要

漏洞赏金平台(如 HackerOne、BugCrowd)利用众包漏洞发现来提高持续覆盖率、降低发现成本,并作为内部红队的重要补充。随着 AI 生成的漏洞报告增多,如何帮助漏洞猎人理解这些报告被标记为无效的原因仍是少数工作所关注的。为了提高报告质量并减轻审稿人的负担,预测无效报告并解释无效原因至关重要。本文旨在帮助漏洞猎人理解报告的有效性,开展了为期研究。我们收集了 9,942 份已披露漏洞报告,其中包括 1,400 份无效报告,并评估了最先进的大语言模型是否能够识别无效报告。虽然 GPT-5、DeepSeek 和微调的 RoBERTa 等模型在整体准确率方面表现良好,但它们始终难以检测无效案例,表现出过度接受报告的倾向。为提高无效性检测效果,我们构建了针对信息披露漏洞的拒绝原因分类体系,并将其纳入检索增强生成(RAG)框架中。该方法显著提高了分类一致性,减少了偏见。我们还检查了审稿人决策是否可能受到报告内容之外因素的影响。我们的分析显示,声誉较高的报告者在边缘情况中更容易获得有利结果,这表明感知到的专业知识可能影响审稿判断。总体而言,我们的发现凸显了无效报告识别的挑战,并表明将大语言模型与结构化审稿知识结合可支持更透明和一致的漏洞报告审查。

关键词

引用

@article{arxiv.2511.18608,
  title  = {From Reviewers' Lens: Understanding Bug Bounty Report Invalid Reasons with LLMs},
  author = {Jiangrui Zheng and Yingming Zhou and Ali Abdullah Ahmad and Hanqing Yao and Xueqing Liu},
  journal= {arXiv preprint arXiv:2511.18608},
  year   = {2025}
}

备注

10 pages, 4 figures