中文

TraceRAG:面向Android恶意软件检测与行为分析的基于LLM的可解释框架

软件工程 2025-09-12 v1

摘要

复杂的规避策略与恶意Android应用程序的精细行为语义相结合,使攻击者能够将恶意逻辑隐藏在合法功能内部,这凸显了对稳健且深入分析框架的关键需求。然而,传统分析技术常常无法恢复深层隐藏的行为,也无法提供其决策的人类可读解释。鼓励大型语言模型(LLM)的进步,我们引入TraceRAG——一个检索增强生成(RAG)框架,将自然语言查询与Java代码相连接,以提供可解释的恶意软件检测与分析。首先,TraceRAG生成方法级别代码片段的摘要,并将其索引到向量数据库中。在查询时,行为聚焦的问题检索与更语义相关的片段,以进行深入检查。最后,基于多轮分析结果,TraceRAG生成人类可读报告,呈现识别出的恶意行为及其对应的代码实现。实验结果表明,我们的方法基于更新的VirusTotal(VT)扫描和手动验证,实现了96%的恶意软件检测准确率和83.81%的行为识别准确率。此外,专家评估确认了TraceRAG生成报告的实际实用性。

关键词

引用

@article{arxiv.2509.08865,
  title  = {TraceRAG: A LLM-Based Framework for Explainable Android Malware Detection and Behavior Analysis},
  author = {Guangyu Zhang and Xixuan Wang and Shiyu Sun and Peiyan Xiao and Kun Sun and Yanhai Xiong},
  journal= {arXiv preprint arXiv:2509.08865},
  year   = {2025}
}