Mono:你的"干净"漏洞数据集真的可解吗?暴露并捕获不可判定补丁及更多
密码学与安全
2025-06-12 v2 软件工程
摘要
漏洞数据集的数量和质量对于开发漏洞相关任务的深度学习解决方案至关重要。由于漏洞的有限可用性,构建此类数据集的常见方法是分析源代码中的安全补丁。然而,现有的安全补丁常常存在标注不准确、上下文信息不足以及不可判定补丁无法清晰表示漏洞根源或修复方式等问题。这些问题在数据集中引入噪声,可能误导检测模型并削弱其有效性。为解决这些问题,我们提出了 mono,一个利用大语言模型模拟人类专家推理过程来构建可靠漏洞数据集的新型框架。mono 引入了三个关键组件以改进安全补丁数据集:(i) 语义感知补丁分类以实现精确漏洞标注,(ii) 迭代上下文分析以实现全面代码理解,(iii) 系统根因分析以识别并过滤不可判定补丁。我们在 MegaVul 基准测试上的全面评估表明,mono 可以纠正 31.0% 的标注错误,恢复 89% 的过程间漏洞,并揭示 16.7% 的 CVE 包含不可判定补丁。此外,mono 丰富的上下文表示将现有模型的漏洞检测准确率提升了 15%。我们在 https://github.com/vul337/mono 开源了 mono 框架和 MonoLens 数据集。
引用
@article{arxiv.2506.03651,
title = {Mono: Is Your "Clean" Vulnerability Dataset Really Solvable? Exposing and Trapping Undecidable Patches and Beyond},
author = {Zeyu Gao and Junlin Zhou and Bolun Zhang and Yi He and Chao Zhang and Yuxin Cui and Hao Wang},
journal= {arXiv preprint arXiv:2506.03651},
year = {2025}
}