面向数据无关的网络安全威胁情报信息提取的可扩展 AI 驱动框架
密码学与安全
2025-01-14 v1 人工智能
计算与语言
摘要
网络安全威胁情报 (CTI) 对减轻针对组织、政府和机构的威胁至关重要,但必要的数据常常分散在多样化格式中。AI驱动的 CTI 信息提取 (IE) 解决方案通常依赖高质量、已注释的数据,而这些数据并非总是可用。本文引入 0-CTI,一个用于高效 CTI 信息提取的可扩展 AI 框架。利用先进的自然语言处理 (NLP) 技术,特别是基于 Transformer 的架构,该系统处理 CTI 报告的完整文本序列,以提取命名实体及其关系的网络情报本体。我们的贡献是开发 0-CTI,这是第一个支持监督学习和零样本学习的 CTI 信息提取模块化框架。不同于依赖大量注释数据集的现有最先进模型,本系统通过为实体和关系提取提供零样本方法,实现完全无数据操作,使其适用于各种数据可用性场景。此外,我们的监督实体提取器超越了当前网络实体提取的最先进性能,凸显了该框架在低资源和数据丰富环境中的双重优势。通过将系统输出与结构化威胁信息表达 (STIX) 格式对齐,这一标准用于网络安全领域的信息交换,0-CTI 标准化了提取的知识,增强了网络安全操作中的沟通与协作。
引用
@article{arxiv.2501.06239,
title = {Towards a scalable AI-driven framework for data-independent Cyber Threat Intelligence Information Extraction},
author = {Olga Sorokoletova and Emanuele Antonioni and Giordano Colò},
journal= {arXiv preprint arXiv:2501.06239},
year = {2025}
}