中文

关于为 Android 恶意软件分析基准测试代码 LLM

密码学与安全 2025-04-24 v2 机器学习

摘要

大型语言模型(LLM)在 various code intelligence tasks 上已显示出强大的能力。然而,其在 Android 恶意软件分析中的有效性尚未得到充分探索。分解后的 Android 恶意软件代码在分析时 presents 独特的挑战,因为恶意逻辑被嵌入大量函数中,且函数名称经常缺乏有意义之名。本文提出了 CAMA(Code Android Malware Analysis 基准框架),旨在系统性地评估 Code LLM 在 Android 恶意软件分析中的有效性。CAMA 指定结构化的模型输出以支持关键恶意软件分析任务,包括恶意函数识别和恶意软件用途概述。基于此,它整合了三个领域特定的评估指标(一致性、忠实度和语义相关性),以实现严密的稳定性和有效性评估以及跨模型比较。我们构建了一个包含 118 个 Android 恶意软件样本(来自 13 个家族)的基准数据集,涵盖超过 750 万个独立函数,并使用 CAMA 对四个流行的开源 Code LLM 进行评估。我们的实验提供了关于 Code LLM 如何解释分解代码的见解,并量化了对函数重命名的敏感性,凸显了其在恶意软件分析中的潜力以及当前的局限性。

关键词

引用

@article{arxiv.2504.00694,
  title  = {On Benchmarking Code LLMs for Android Malware Analysis},
  author = {Yiling He and Hongyu She and Xingzhi Qian and Xinran Zheng and Zhuo Chen and Zhan Qin and Lorenzo Cavallaro},
  journal= {arXiv preprint arXiv:2504.00694},
  year   = {2025}
}

备注

This paper has been accepted to the 34th ACM SIGSOFT ISSTA Companion (LLMSC Workshop 2025)