降低安全分类器训练成本(通过优化半监督学习)
密码学与安全
2022-05-03 v1 软件工程
摘要
背景:现有多数面向安全任务(如垃圾邮件检测、恶意软件检测或网络入侵检测)的机器学习模型基于监督式机器学习算法构建。在此范式下,模型需要大量标注数据以学习所选特征与目标类别间的有用关系。然而,此类标注数据可能稀缺且获取成本高昂。目标:在仅有少量标注训练数据而大量未标注训练数据可用时,帮助安全从业者训练有用的安全分类模型。方法:我们提出一种称为Dapper的自适应框架,其优化 1) 以传播范式给未标注数据赋伪标签的半监督学习算法,以及 2) 机器学习分类器(即随机森林)。当数据集类别高度不平衡时,Dapper进而自适应地集成并优化一种称为SMOTE的数据过采样方法。我们使用新颖的贝叶斯优化来搜索这些调优目标的大超参数空间。结果:我们使用三个安全数据集评估Dapper,即Twitter垃圾邮件数据集、恶意URL数据集与CIC-IDS-2017数据集。实验结果表明,我们仅使用原始标注数据的10%,即可达到甚至优于以监督方式使用100%标注数据的分类性能。结论:基于这些结果,我们建议在处理标注安全数据短缺时,将超参数优化与半监督学习结合使用。
引用
@article{arxiv.2205.00665,
title = {Reducing the Cost of Training Security Classifier (via Optimized Semi-Supervised Learning)},
author = {Rui Shu and Tianpei Xia and Huy Tu and Laurie Williams and Tim Menzies},
journal= {arXiv preprint arXiv:2205.00665},
year = {2022}
}