中文

破坏警戒塔:基于对抗日志内容的 LLM 增强式安全运营提示注入攻击

密码学与安全 2026-05-26 v1 机器学习

摘要

大语言模型(LLM)日益被用于安全运营中心(SOC)中的分析师助理,他们接收日志和警报数据以生成分流标签、事件摘要或修复建议。我们研究这一设计的结构性缺陷:许多日志字段由攻击者控制。用户代理、URL、负载、DNS 查询和尝试的用户名因此可携带指令传递给模型,同时作为入侵证据。我们称此设定为"日志基质提示注入"。我们引入四类日志基质攻击范畴:直接覆盖(S1)、人格劫持(S2)、上下文操纵(S3)和隐蔽载荷(S4)。我们使用 gpt-4o-mini 作为分析师评估 48 种策略-防御-任务组合。三个关键发现值得注意。首先,在本实验中,所有 S1 分类攻击均实现 0\% 抑制;相比之下,人格劫持在朴素分类器下抑制 68\% 的恶意日志,并在更强防御下仍保持有效。其次,摘要是最高风险任务:上下文操纵在无防御时达到 96\% 注入成功率,即使在受约束输出下也达 38\%。第三,防御虽降低但未消除攻击面:平均注入成功率从朴素提示下的 26.6\% 降至最强防御下的 11.8\%。我们还与确定性模拟分析师进行比较,发现仿真在预测当前模型行为方差不大,尤其是针对直接覆盖。这些结果表明,SOC 助理应将原始日志内容视为对抗性输入而非普通分析师上下文。

关键词

引用

@article{arxiv.2605.24421,
  title  = {Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content},
  author = {Rohan Pandey and Archit Bhujang},
  journal= {arXiv preprint arXiv:2605.24421},
  year   = {2026}
}

备注

10 pages