用于域名生成算法检测的 LLM
计算与语言
2024-11-06 v1 密码学与安全
摘要
本工作分析了大语言模型(LLM)在检测域名生成算法(DGA)中的应用。我们对两项重要技术进行了详细评估:上下文学习(ICL)和监督微调(SFT),展示了它们如何改进检测。SFT 通过使用特定领域数据来提高性能,而 ICL 则帮助检测模型快速适应新威胁,无需大量重新训练。我们使用 Meta 的 Llama3 8B 模型,在一个包含 68 个恶意软件家族和正常域名的自定义数据集上进行实验,涵盖了多种难以检测的方案,包括最近出现的基于单词的 DGA。结果证明,基于 LLM 的方法可以在 DGA 检测中取得有竞争力的结果。特别是,基于 SFT 的 LLM DGA 检测器优于使用注意力层的 SOTA 模型,实现了 94% 的准确率和 4% 的误报率(FPR),并且在检测基于单词的 DGA 域名方面表现出色。
引用
@article{arxiv.2411.03307,
title = {LLMs for Domain Generation Algorithm Detection},
author = {Reynier Leyva La O and Carlos A. Catania and Tatiana Parlanti},
journal= {arXiv preprint arXiv:2411.03307},
year = {2024}
}