知己知彼:通过多样化数据合成与指令级思维链学习保护 LLM 免受提示注入攻击
人工智能
2026-04-10 v2 密码学与安全
摘要
集成大语言模型(LLM)的应用日益普及,但面临着来自提示注入(PI)攻击的严重安全漏洞。防御 PI 攻击面临两个主要问题:恶意指令可以通过多种向量注入,且注入的指令通常与周围上下文之间缺乏清晰的语义边界,使其难以被识别。为了解决这些问题,我们提出了 InstruCoT,一种用于 PI 防御的模型增强方法。该方法合成多样化的训练数据,并采用指令级思维链微调,使 LLM 能够有效地识别并拒绝恶意指令,无论其在上下文中的来源或位置如何。我们从三个关键维度对 InstruCoT 进行了评估:行为偏差、隐私泄露和有害输出。在四个 LLM 上的实验结果表明,InstruCoT 在所有维度上均显著优于基线方法,同时保持了效用性能且未出现退化。
引用
@article{arxiv.2601.04666,
title = {Know Thy Enemy: Securing LLMs Against Prompt Injection via Diverse Data Synthesis and Instruction-Level Chain-of-Thought Learning},
author = {Zhiyuan Chang and Mingyang Li and Yuekai Huang and Ziyou Jiang and Xiaojun Jia and Qian Xiong and Junjie Wang and Zhaoyang Li and Qing Wang},
journal= {arXiv preprint arXiv:2601.04666},
year = {2026}
}
备注
19 pages, 6 figures; accepted by ACL 2026 Findings