中文

评估用于基于 OSINT 的网络威胁态势感知的 LLM 聊天机器人

密码学与安全 2025-05-07 v3 计算与语言 机器学习

摘要

在快速发展的网络安全领域,关于新兴威胁的知识共享至关重要,并构成了网络威胁情报 (CTI) 的基础。在此背景下,大语言模型在网络安全领域变得日益重要,展现出广泛的机遇。本研究调查了 ChatGPT、GPT4all、Dolly、Stanford Alpaca、Alpaca-LoRA、Falcon 和 Vicuna 聊天机器人在使用开源情报 (OSINT) 执行的二分类和命名实体识别 (NER) 任务中的性能。我们利用先前研究中从 Twitter 收集的成熟数据集,评估这些聊天机器人与针对这些任务训练的专用模型相比的竞争力。在二分类实验中,作为商业模型的聊天机器人 GPT-4 取得了可接受的 F1 分数 0.94,开源模型 GPT4all 取得了 0.90 的 F1 分数。然而,在网络安全实体识别方面,所有被评估的聊天机器人都有局限性且效果较差。本研究展示了聊天机器人用于 OSINT 二分类的能力,并表明它们在 NER 方面需要进一步改进才能有效替代专门训练的模型。我们的结果揭示了 LLM 聊天机器人与专用模型相比的局限性,并可以帮助研究人员改进聊天机器人技术,目标是减少将机器学习集成到基于 OSINT 的 CTI 工具中所需的努力。

关键词

引用

@article{arxiv.2401.15127,
  title  = {Evaluation of LLM Chatbots for OSINT-based Cyber Threat Awareness},
  author = {Samaneh Shafee and Alysson Bessani and Pedro M. Ferreira},
  journal= {arXiv preprint arXiv:2401.15127},
  year   = {2025}
}