数据集规模与类别不平衡对基于机器学习的 Windows 恶意软件检测技术评估的影响
密码学与安全
2022-06-14 v1 机器学习
摘要
本项目的目的是收集并分析关于已发表成果的可比性与实际适用性的数据,重点关注微软 Windows 恶意软件,更具体地说是数据集规模与测试集不平衡对测得检测器性能的影响。一些研究者使用较小的数据集,而如果数据集规模对性能有显著影响,则会使已发表结果之间的比较变得困难。研究者还倾向于使用平衡数据集并以准确率为度量进行测试。前者并非对现实的真实表征(现实中良性样本远多于恶意样本),而后者已知对不平衡问题存在缺陷。本项目确定了两个关键目标:理解数据集规模是否与测得的检测器性能相关到阻碍已发表结果有意义比较的程度;以及理解已发表研究中报告的良好性能是否可预期在真实部署场景中表现良好。研究结果表明,数据集规模确实与测得的检测器性能相关到阻碍已发表结果有意义比较的程度,且在未理解已发表结果的训练集规模—准确率曲线性质之前,不应仅基于准确率分数对不同方法“更优”的结论下判断。结果还表明,高准确率分数未必转化为高真实世界性能。
引用
@article{arxiv.2206.06256,
title = {On the impact of dataset size and class imbalance in evaluating machine-learning-based windows malware detection techniques},
author = {David Illes},
journal= {arXiv preprint arXiv:2206.06256},
year = {2022}
}
备注
Project report for my MSc project at The Open University originally submitted to obtain an MSc in Cyber Security