中文

超越检测:面向细粒度 Webshell 家族分类的综合基准与研究

密码学与安全 2025-12-08 v1 人工智能 机器学习

摘要

恶意 WebShell 通过破坏关键数字基础设施,危及医疗和金融等部门的公共服务。尽管研究社区在 WebShell 检测(即区分恶意样本与良性样本)方面取得了显著进展,但我们认为此时已应从被动检测转向深入分析和主动防御。一个可行方向是自动化 WebShell 家族分类,通过识别特定恶意软件谱系来理解对手的战术,从而实现精准、快速的响应。然而,这一关键任务目前仍基本未被探索,依赖缓慢的手动专家分析。为此,我们首次系统性地研究了自动化 WebShell 家族分类。我们的方法从提取动态函数调用轨迹来捕获抗干扰的内在行为。为增强数据集的规模和多样性以实现更稳定的评估,我们利用大语言模型合成新的变体来增强这些真实世界的轨迹。这些增强后的轨迹随后被抽象为序列、图和树,为评估一套全面的表示方法提供了基准。我们的评估涵盖经典基于序列的嵌入 (CBOW、GloVe)、变换器 (BERT、SimCSE) 以及各种结构感知算法,包括图核、图编辑距离、Graph2Vec 和各种图神经网络。在四个真实世界、带家族标注的数据集上,以监督和非监督方式进行大量实验,我们建立了稳健的基准,并为此一挑战提供了实用见解,揭示了数据抽象、表示模型和学习范式的最有效组合。

关键词

引用

@article{arxiv.2512.05288,
  title  = {Beyond Detection: A Comprehensive Benchmark and Study on Representation Learning for Fine-Grained Webshell Family Classification},
  author = {Feijiang Han},
  journal= {arXiv preprint arXiv:2512.05288},
  year   = {2025}
}