用于恶意软件检测的并行实例过滤
密码学与安全
2022-06-29 v1 机器学习
摘要
机器学习算法广泛用于恶意软件检测领域。随着样本量增长,分类算法的训练愈发昂贵。此外,训练数据集可能含冗余或噪声实例。待解决的问题是如何在不降低准确率的前提下从大型训练集中选取代表性实例。本文提出一种称为并行实例过滤(PIF)的新并行实例选择算法。算法核心思想是将数据集划分为覆盖全集且不重叠的实例子集,并对各子集施加过滤过程。每个子集由具有相同最近敌手的实例组成。因此,由于子集间使用并行计算独立处理,PIF 算法速度快。我们在含 500,000 个恶意与良性样本的大型数据集上将 PIF 与若干最先进实例选择算法比较。特征集通过静态分析提取,包含来自可移植可执行文件格式的元数据。实验结果表明,所提实例选择算法显著缩减训练集规模,且仅轻微降低准确率。就平均分类准确率与存储百分比之比而言,PIF 算法优于实验中使用的现有实例选择方法。
引用
@article{arxiv.2206.13889,
title = {Parallel Instance Filtering for Malware Detection},
author = {Martin Jureček and Olha Jurečková},
journal= {arXiv preprint arXiv:2206.13889},
year = {2022}
}