从 IOCs 到 Regex:基于 LLM 的 SOC 自动化 CTI 实施
密码学与安全
2026-04-15 v1
摘要
Cyber Threat Intelligence (CTI) 报告包含 Compromise Indicators (IOCs),是安全运营的关键要素。为在异构日志中实现这些 IOCs,分析师通常将其转换为正则表达式 (regex) 以完成数字取证、日志解析及 SIEM 规则创建等任务。然而,regex 构建仍大多依赖手动操作,要求分析师从 CTI 报告中提取 IOCs 并转化为语法有效且语义精确的模式。此过程缓慢且易出错,随着 CTI 数量增长变得日益不可行。虽然近期研究已应用大语言模型 (LLM) 处理 IOCs 提取,但通常仅输出纯字符串,限制了实际部署。纯粹的 IOCs 无法有效捕捉系统上下文、日志格式或攻击者行为的变体。为填补这一空白,我们提出 IOCRegex-gen 系统,实现 IOCs 到 regex 的全自动 LLM 生成。该系统引入两项关键创新:(i) 基于组的机制识别 IOCs 各段应表示为捕获或非捕获组的方式;(ii) 迭代推理与多阶段验证管道确保语法有效性与语义正确性。实验在 3000 余份真实 CTI 报告与 2400 份来自 MITRE ATT&CK Evaluation 框架的 ground-truth 字符串上进行,表明 IOCRegex-gen 在平均命中率达 99.1%,误报率仅 0.8%,显现出在大规模 CTI 处理与自动化 regex 生成方面的有效性。
引用
@article{arxiv.2604.12228,
title = {From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs},
author = {Pei-Yu Tseng and Lan Zhang and ZihDwo Yeh and Xiaoyan Sun and Xushu Dai and Peng Liu},
journal= {arXiv preprint arXiv:2604.12228},
year = {2026}
}