中文

基于主动学习的 Android 恶意软件多标签分类

密码学与安全 2024-10-10 v1

摘要

现有恶意软件分类方法(即二分类和家族分类)几乎无法为后续分析提供有益输出。即便是家族分类方法,也存在缺乏正式命名标准和恶意行为定义不完整的问题。更重要的是,现有方法无法处理单一恶意软件具有多种恶意行为的情况,而这在野外 Android 恶意软件中非常常见。因此,这两种方法都无法为研究人员提供足够直接且全面的理解。本文提出了 MLCDroid,这是一种基于机器学习的多标签分类方法,可直接指示预定义恶意行为的存在。通过深入分析,我们总结了来自真实世界恶意软件的六种基本恶意行为,并构建了标记数据集。我们对70种算法组合进行比较,以评估其有效性(最佳为73.3%)。面临数据标注昂贵成本的挑战,我们进一步提出了基于数据增强的主动学习方法,通过从未标记的恶意软件数据集中获得5000多条高质量样本,整体准确率可提升至86.7%。这是首个旨在为细粒度恶意行为提供更多信息的 Android 多标签恶意软件分类方法。

关键词

引用

@article{arxiv.2410.06444,
  title  = {Multi-label Classification for Android Malware Based on Active Learning},
  author = {Qijing Qiao and Ruitao Feng and Sen Chen and Fei Zhang and Xiaohong Li},
  journal= {arXiv preprint arXiv:2410.06444},
  year   = {2024}
}

备注

18 pages, in IEEE Transactions on Dependable and Secure Computing, 2022