Virus-MNIST:一个基准恶意软件数据集
密码学与安全
2021-03-02 v1 机器学习
摘要
本短札介绍了一个图像分类数据集,其包含10种可执行代码类别及约50,000个病毒样本。恶意类别包括9个计算机病毒家族和一个良性集合。对可移植可执行文件(PE)前1024字节的图像格式化方式仿照了熟悉的MNIST手写数字数据集,使得大多数先前探究的算法方法经微小修改即可迁移。用于恶意软件的9个病毒家族的指定源自类标签的无监督学习;我们通过排除非恶意样本的KMeans聚类发现了这些家族。作为使用深度学习方法(MobileNetV2)的基准,我们发现当包含良性软件时,按家族进行病毒识别的总体准确率为80%。我们还发现,一旦检测到阳性恶意软件(通过签名或启发式方法),将前1024字节投影为缩略图图像即可以87%的准确率对病毒类型进行分类。该工作推广了其他恶意软件研究者已证明的有前景的卷积神经网络——其最初为解决图像问题而开发,但被应用于来自可执行文件的像素字节这一新抽象域。该数据集可在Kaggle和Github上获取。
引用
@article{arxiv.2103.00602,
title = {Virus-MNIST: A Benchmark Malware Dataset},
author = {David Noever and Samantha E. Miller Noever},
journal= {arXiv preprint arXiv:2103.00602},
year = {2021}
}