中文

针对压缩可执行文件的对抗鲁棒汇编语言模型

密码学与安全 2025-09-22 v1

摘要

检测压缩可执行文件是大规模恶意软件分析和防病毒引擎工作流程中的关键组件,因为它识别需要进行计算密集型动态解压以揭示隐藏恶意行为的样本。传统的压缩器检测技术依赖经验特征,如高熵或特定二进制模式。然而,这些经验、基于特征的方法正日益暴露于对抗样本或未知压缩器(例如低熵压缩器)的规避。此外,依赖专家精心构建的特征在维持和演进这些方法方面存在挑战。本文检视了现有压缩器检测方法的局限性,提出了Pack-ALM,这是一种基于深度学习的新方法,用于检测压缩可执行文件。我们受语言学区分真实单词与伪单词概念的启发,将压缩器检测重新定义为区分合法指令与“伪”指令的任务。为实现这一目标,我们预处理本机数据和压缩数据为“伪”指令,并设计了一个预训练的汇编语言模型,识别指示压缩数据的特征。我们对Pack-ALM进行评估,与领先的工业压缩器检测工具和最先进的汇编语言模型进行比较。对37,000多个样本的广泛实验表明,Pack-ALM有效识别了压缩二进制文件,包括使用对抗或先前未知压缩技术创建的样本。此外,Pack-ALM在检测准确率和对抗鲁棒性方面均优于传统基于熵的方法和先进的汇编语言模型。

关键词

引用

@article{arxiv.2509.15499,
  title  = {Adversarially Robust Assembly Language Model for Packed Executables Detection},
  author = {Shijia Li and Jiang Ming and Lanqing Liu and Longwei Yang and Ni Zhang and Chunfu Jia},
  journal= {arXiv preprint arXiv:2509.15499},
  year   = {2025}
}

备注

Accepted by ACM CCS 2025