中文

构建 Android 恶意软件检测的机器学习流水线:实践、挑战与机遇的程序化综述

密码学与安全 2023-06-13 v1 机器学习

摘要

作为智能手机市场的领导者,Android 一直是恶意软件攻击的重要目标。过去十年中,为其识别出的恶意应用程序(apps)数量持续增加,给所有相关方带来了巨大挑战。特别是对于市场运营方和研究人员而言,海量样本使得人工恶意软件检测不可行,从而催生了大量研究机器学习(ML)方法以自动化该过程的工作。然而,尽管一些所提出的方法取得了高性能,快速演化的 Android 恶意软件使它们无法随时间保持准确率。这在社区中产生了开展进一步研究并构建更灵活的 ML 流水线的需求。但当前由于缺乏对已发表文献的系统性概览,难以借鉴并改进现有方案,从而阻碍了这一进程。现有综述论文往往只关注 ML 流程的某些部分(例如数据收集或模型部署),而忽略其他重要阶段,如模型评估与解释。在本文中,我们通过回顾 42 篇高被引论文来解决此问题,这些论文跨越了十年的研究(2011 至 2021 年)。我们提出了一种新颖的程序化分类法,涵盖这些文献如何使用 ML 算法、设计了哪些特征、采用了何种降维技术、使用了哪些数据集进行训练,以及它们的评估与解释策略。基于该分类法,我们还识别了知识空白,并提供了改进与未来工作的思路。

关键词

引用

@article{arxiv.2306.07118,
  title  = {On building machine learning pipelines for Android malware detection: a procedural survey of practices, challenges and opportunities},
  author = {Masoud Mehrabi Koushki and Ibrahim AbuAlhaol and Anandharaju Durai Raju and Yang Zhou and Ronnie Salvador Giagone and Huang Shengqiang},
  journal= {arXiv preprint arXiv:2306.07118},
  year   = {2023}
}

备注

file:///C:/Users/ibrahim_abualhaol/Downloads/s42400-022-00119-8.pdf