中文

少即是足:用于漏洞检测的正类与未标记学习模型

软件工程 2023-08-22 v1 人工智能 密码学与安全

摘要

自动化代码漏洞检测近年来受到越来越多的关注。基于深度学习(DL)的方法隐式学习漏洞代码模式,已被证明在漏洞检测中有效。DL方法的性能通常依赖于标注数据的数量与质量。然而,当前的标注数据一般为自动收集,例如从人工生成的提交记录中爬取,难以保证标签质量。已有研究表明,常用数据集中非漏洞代码(即负标签)往往不可靠,而漏洞代码(即正标签)则更为确定。考虑到实践中存在大量未标记数据,利用正类数据与大量未标记数据以实现更精准的漏洞检测是必要且值得探索的。本文关注漏洞检测中的正类与未标记(PU)学习问题,并提出一种名为PILOT的新模型,即用于漏洞检测的Positive and Unlabeled Learning模型。PILOT仅从正类与未标记数据中学习以进行漏洞检测。它主要包含两个模块:(1)距离感知标签选择模块,旨在为选定的未标记数据生成伪标签,涉及类间距离原型与渐进式微调;(2)混合监督表示学习模块,以进一步减轻噪声影响并增强表示的判别力。

关键词

引用

@article{arxiv.2308.10523,
  title  = {When Less is Enough: Positive and Unlabeled Learning Model for Vulnerability Detection},
  author = {Xin-Cheng Wen and Xinchen Wang and Cuiyun Gao and Shaohua Wang and Yang Liu and Zhaoquan Gu},
  journal= {arXiv preprint arXiv:2308.10523},
  year   = {2023}
}

备注

This paper is accepted by ASE 2023