中文

关于 Android 恶意软件数据集中语义相似应用的影响

密码学与安全 2021-12-07 v1

摘要

恶意软件作者复用其他应用中的相同程序段以执行类似恶意活动,如信息窃取、发送短信等。因此,一个家族/数据集中可能存在若干语义相似的恶意样本。许多研究者未意识到这些语义相似应用,并在其 ML 模型中使用了它们的特征进行评估,因而性能度量可能受到此类相似应用的严重影响。本文研究语义相似应用在基于 ML 的 Android 恶意软件检测器性能度量中的影响。为此,我们提出一种新颖的基于操作码子序列的恶意软件聚类算法,以识别语义相似的恶意与良性应用。为研究语义相似应用对性能度量的影响,我们基于含/不含语义相似应用的恶意与良性应用的 API 调用与权限特征测试了不同 ML 模型的性能。在 Drebin 数据集的实验中,我们发现从数据集中移除精确重复应用(? = 0)后,基于 API 调用的 ML 模型恶意检测率(TPR)由 0.95 降至 0.91,基于权限的模型由 0.94 降至 0.90。为克服该问题,我们建议研究界在评估其恶意软件检测机制前使用我们的聚类算法剔除语义相似应用。

关键词

引用

@article{arxiv.2112.02606,
  title  = {On Impact of Semantically Similar Apps in Android Malware Datasets},
  author = {Roopak Surendran},
  journal= {arXiv preprint arXiv:2112.02606},
  year   = {2021}
}

备注

9 Pages