多族恶意软件模型
密码学与安全
2022-07-05 v1 机器学习
摘要
在训练机器学习模型时,准确率和数据集的多样性之间可能存在权衡。先前的研究表明,若我们训练一个模型来检测某一特定恶意软件族,通常比在多个不同族上训练单一模型获得更强的效果。然而,在检测阶段,拥有一个能够可靠检测多个族的单一模型会比针对多个模型对每个样本进行打分更为高效。在本研究中,我们基于字节 -gram 特征进行实验,在恶意软件检测问题的背景下量化训练数据集的通用性与相应机器学习模型准确率之间的关系。我们发现,基于邻域的算法泛化能力出奇地好,远优于所考虑的其他机器学习技术。
引用
@article{arxiv.2207.00620,
title = {Multifamily Malware Models},
author = {Samanvitha Basole and Fabio Di Troia and Mark Stamp},
journal= {arXiv preprint arXiv:2207.00620},
year = {2022}
}