中文

MalRAG:面向开放集恶意流量识别的检索增强型大语言模型框架

密码学与安全 2025-11-19 v1 机器学习

摘要

精细化识别 IDS 标记的可疑流量在网络安全领域至关重要。实际情况下,网络威胁不断演变,发现新型恶意流量与识别已知类别都成为关键需求。近期研究通过深度模型推进了这一目标,但常依赖于特定任务的架构,限制了可迁移性并需针对数据集进行微调。本文引入 MalRAG,首个驱动型检索增强框架用于开放集恶意流量识别。MalRAG 冻结大语言模型,通过全面的流量知识构建、自适应检索和提示工程实现运行。具体而言,我们从内容、结构和时间三个视角开采先前恶意流量,构建多视图流量数据库。进而引入覆盖率增强检索算法,对这些视角进行查询,以组装最可能的候选项,从而提高正确证据的包含率。随后采用流量感知自适应修剪,依据流量感知相似度得分选取变数量的候选子集,抑制错误匹配,获得可靠检索证据。此外,我们开发一套指导性提示,其中集成了任务指令、证据引用与决策指引,以提升检索证据的大语言模型性能。在多样化真实世界数据集与场景下,MalRAG 在已知类别的精细识别与新型恶意流量发现中均达到最先进水平。消融与深度分析进一步表明,MalRAG 有效利用大语言模型能力,却无需依赖特定大语言模型即可实现开放集恶意流量识别。

关键词

引用

@article{arxiv.2511.14129,
  title  = {MalRAG: A Retrieval-Augmented LLM Framework for Open-set Malicious Traffic Identification},
  author = {Xiang Luo and Chang Liu and Gang Xiong and Chen Yang and Gaopeng Gou and Yaochen Ren and Zhen Li},
  journal= {arXiv preprint arXiv:2511.14129},
  year   = {2025}
}

备注

13 pages, 13 figures. Intended for submission to IEEE Transactions on Information Forensics and Security (TIFS)