基于 Transformer 的漏洞检测在开源与产业数据上的跨域评估
软件工程
2025-11-25 v1
摘要
学术研究中提出的深度学习漏洞检测解决方案往往难以为开发者所用,且其在工业环境中的适用性也屈指可数。将此类技术从学术界移植到产业界存在诸多挑战,包括可信度、遗留系统、数字素养有限以及学术与产业专业知识之间的鸿沟。对于深度学习方法而言,性能和融入现有工作流程也是额外的顾虑。在本文中,我们首先评估了CodeBERT在检测开源软件和工业软件中脆弱函数的性能。分析了其在不同数据集上微调后在另一数据集上的跨域泛化,尤其关注类别不平衡的处理策略。基于这些结果,我们开发了AI-DO(自动化漏洞检测集成于开发者运营),一个集成持续集成-持续部署(CI/CD)的推荐系统,利用微调后的CodeBERT在代码审查期间检测并定位漏洞,而不干扰工作流程。最后,我们通过对公司IT专业人员的调查来评估该工具的实用性。结果表明,训练于工业数据的数据集在同一领域内能够准确检测漏洞,但在开源代码上表现下降;而使用适当欠抽样技术在开源数据上微调的深度学习模型可提高漏洞检测效果。
引用
@article{arxiv.2509.09313,
title = {Cross-Domain Evaluation of Transformer-Based Vulnerability Detection on Open & Industry Data},
author = {Moritz Mock and Thomas Forrer and Barbara Russo},
journal= {arXiv preprint arXiv:2509.09313},
year = {2025}
}
备注
Accepted to the 26th International Conference on Product-Focused Software Process Improvement (PROFES 2025)