中文

面向软件漏洞检测的Mixup式数据增强方法研究

软件工程 2025-04-29 v3 密码学与安全 机器学习

摘要

各类深度学习(DL)方法近期被用于检测软件漏洞。然而,现实世界的软件漏洞数据集稀缺且难以获取,因为没有简单的数据集分类漏洞的度量标准。此类数据集严重不平衡,且当前数据集对DL模型而言规模不足。为此,最近的研究尝试通过源代码生成逼真的单语句漏洞来增强数据集,但这种方法不够实用,需要人工检查生成的漏洞。本文旨在探索在表示层面上进行漏洞数据增强,以帮助当前模型更好地学习,这种做法在我们所知述的文献中尚未有人尝试。我们实现并评估了五种数据嵌入的增强技术,这些技术曾用于代码搜索,是完全不同的软件工程任务。我们还引入了这些增强方法的条件版本,确保增强不会改变向量表示中易感部分。我们展示,这些增强方法有助于提高F1分数,可提升最高9.67%,但无法超越随机过采样,当数据集不平衡时,后者可将F1分数提高10.82%。

关键词

引用

@article{arxiv.2504.15632,
  title  = {A Study on Mixup-Inspired Augmentation Methods for Software Vulnerability Detection},
  author = {Seyed Shayan Daneshvar and Da Tan and Shaowei Wang and Carson Leung},
  journal= {arXiv preprint arXiv:2504.15632},
  year   = {2025}
}

备注

Accepted at EASE 2025, Istanbul, Turkey