SLIP:针对API中指令后门的软标签机制与关键提取引导的思维链防御
密码学与安全
2026-04-17 v3
摘要
定制化大语言模型(LLM)智能体面临来自黑盒指令后门的严重安全威胁,其中恶意行为通过隐藏的系统指令被秘密注入。尽管现有的基于提示的防御通常能检测到被污染的输入,但一旦后门被激活,它们通常无法恢复正确的输出。在本文中,我们首先对指令后门下的 LLM 行为进行了机制分析,并揭示了两个关键现象:(1)认知覆盖,即后门触发器主导推理过程并抑制任务相关上下文;(2)异常语义关联,即触发器与攻击者指定的目标标签建立了过强的语义关联。基于这些见解,我们提出了一种针对 API 中指令后门的软标签机制与关键提取引导的思维链防御(SLIP)。为了对抗认知覆盖,关键提取引导的思维链(KCOT)显式地引导模型提取与任务相关的关键词和短语,而不是仅考虑单个触发器或整体文本语义。为了中和触发器的异常语义关联,软标签机制(SLM)量化语义关联,并采用统计聚类在聚合可靠的关键词和短语进行预测之前过滤异常短语。大量实验表明,SLIP 将平均攻击成功率降低至 25.13%,将干净准确率提升至 87.15%,并且优于最先进的黑盒防御。
引用
@article{arxiv.2508.06153,
title = {SLIP: Soft Label Mechanism and Key-Extraction-Guided CoT-based Defense Against Instruction Backdoor in APIs},
author = {Zhengxian Wu and Juan Wen and Wanli Peng and Haowei Chang and Yinghan Zhou and Yiming Xue},
journal= {arXiv preprint arXiv:2508.06153},
year = {2026}
}
备注
This paper has been accepted to ACL Findings 2026