中文

探索大语言模型用于Android恶意软件的语义分析与分类

密码学与安全 2025-01-10 v1 人工智能

摘要

恶意软件分析是检查和评估恶意软件功能、来源及潜在影响的复杂过程。这一艰巨的过程通常涉及对软件进行剖析,以了解其组件、感染媒介、传播机制和有效载荷。多年来,对恶意软件的深度逆向工程变得越来越繁琐,这主要是由于现代恶意代码库的快速演变和复杂性。本质上,分析人员的任务是在零日恶意软件的复杂性中识别出难以捉摸的“大海捞针”,且这一切都在严格的时间限制下进行。因此,在本文中,我们探索利用大语言模型(LLM)进行语义恶意软件分析,以加速对已知和新型样本的分析。基于GPT-4o-mini模型,\msp旨在通过分层摘要链和策略性提示工程来增强Android的恶意软件分析。此外,\msp执行恶意软件分类,将潜在恶意软件与良性应用程序区分开来,从而在恶意软件逆向工程过程中节省时间。尽管未针对Android恶意软件分析进行微调,但我们证明,通过优化和高级的提示工程,\msp可以实现高达77%的分类准确率,同时在功能、类和包级别提供高度稳健的摘要。此外,利用从包级别到功能级别的摘要反向追踪,我们能够精确定位导致恶意行为的精确代码片段。

关键词

引用

@article{arxiv.2501.04848,
  title  = {Exploring Large Language Models for Semantic Analysis and Categorization of Android Malware},
  author = {Brandon J Walton and Mst Eshita Khatun and James M Ghawaly and Aisha Ali-Gombe},
  journal= {arXiv preprint arXiv:2501.04848},
  year   = {2025}
}