中文

使用HASTE主动强化LLM防御

密码学与安全 2026-01-28 v1

摘要

基于提示的攻击技术是安全部署和保护基于LLM的AI系统的主要挑战之一。LLM输入是一个无界、非结构化的空间。因此,有效防御这些攻击需要主动强化策略,能够持续生成自适应攻击向量以在运行时优化LLM防御。我们提出了HASTE(难例攻击样本训练引擎):一个系统框架,在模块化优化过程中迭代地设计高度规避的提示,以持续增强针对基于提示的攻击技术的检测效能。该框架与合成数据生成方法无关,并且可以推广到评估提示注入检测效能,无论是否使用模糊测试,适用于任何难负例或难正例迭代策略。对HASTE的实验评估表明,难负例挖掘成功规避了基线检测器,将基线检测器的恶意提示检测率降低了约64%。然而,当与检测模型重新训练集成时,与相对基线策略相比,它用显著更少的迭代循环优化了提示检测模型的效能。HASTE框架支持LLM防御和护栏的主动和被动强化。在主动方面,开发者可以利用HASTE动态地对提示注入检测系统进行压力测试;高效地识别弱点并加强防御态势。在被动方面,HASTE可以模仿新观察到的攻击类型,并通过教导HASTE优化的检测模型识别它们来快速弥合检测覆盖范围。

关键词

引用

@article{arxiv.2601.19051,
  title  = {Proactive Hardening of LLM Defenses with HASTE},
  author = {Henry Chen and Victor Aranda and Samarth Keshari and Ryan Heartfield and Nicole Nichols},
  journal= {arXiv preprint arXiv:2601.19051},
  year   = {2026}
}

备注

Accepted at peer review NDSS 2026, Last-X workshop. Camera ready copy forthcoming