中文

超越分类:评估 LLM 进行细粒度自动恶意软件行为审计

密码学与安全 2025-09-19 v1 人工智能 软件工程

摘要

自动恶意软件分类已取得强大的检测性能。然而,恶意软件行为审计寻求揭示恶意活动的因果和可验证解释——这不仅关乎揭示恶意软件的功能,还关乎以证据为其主张提供支撑。这一任务具有挑战性,因为恶意意图常常隐藏在复杂、框架丰富的应用中,使得手动审计缓慢且昂贵。大型语言模型(LLM)可能有助于弥补这一差距,但其审计潜力仍鲜有探索,主要归因于三个局限:(1) 稀缺的细粒度注释限制公平评估;(2) 丰富的良性代码掩盖恶意信号;(3) 不可验证、易产生幻觉的输出削弱归因的可信度。为弥合这一差距,我们引入 MalEval,一个为细粒度 Android 恶意软件审计而设计的全面框架,旨在评估 LLM 在现实约束下的审计效果。MalEval 提供专家验证的报告和更新的敏感 API 列表,以缓解真实数据稀缺问题并通过静态可达性分析降低噪声。函数级结构表示作为可验证评估的中间归因单元。基于此,我们定义了四个面向分析师的任务——函数优先级排序、证据归因、行为合成和样本区分——并配套领域特定指标和统一的工作负载导向得分。我们在最新恶意软件和误分类良性应用的数据集上评估了七个广泛使用的 LLM,首次系统性地评估了它们的审计能力。MalEval 揭示了审计各阶段的潜在希望与关键局限,提供可复现的基准和面向未来研究的基础。MalEval 已公开于 https://github.com/ZhengXR930/MalEval.git

引用

@article{arxiv.2509.14335,
  title  = {Beyond Classification: Evaluating LLMs for Fine-Grained Automatic Malware Behavior Auditing},
  author = {Xinran Zheng and Xingzhi Qian and Yiling He and Shuo Yang and Lorenzo Cavallaro},
  journal= {arXiv preprint arXiv:2509.14335},
  year   = {2025}
}