软指令降级防御
密码学与安全
2026-01-21 v2 机器学习
摘要
大语言模型(LLM)越来越多地被部署在能够与外部环境交互的智能体系统中;这使得它们在处理不可信数据时容易受到提示注入攻击。为了克服这一限制,我们提出了SIC(软指令控制)——一种简单而有效的迭代提示净化循环,专为工具增强的LLM智能体设计。我们的方法反复检查传入数据中可能危及智能体行为的指令。如果发现此类内容,恶意内容将被重写、屏蔽或移除,并对结果重新评估。该过程持续进行,直到输入干净或达到最大迭代限制;如果仍然存在类似命令式指令的内容,智能体将停止以确保安全。通过允许多次传递,我们的方法承认单次重写可能失败,但使系统能够在后续步骤中捕获并纠正遗漏的注入。尽管立即可用,但最坏情况分析表明SIC并非万无一失;强大的对手仍然可以通过嵌入非命令式工作流获得15%的攻击成功率。但这仍然提高了防御门槛。
引用
@article{arxiv.2510.21057,
title = {Soft Instruction De-escalation Defense},
author = {Nils Philipp Walter and Chawin Sitawarin and Jamie Hayes and David Stutz and Ilia Shumailov},
journal= {arXiv preprint arXiv:2510.21057},
year = {2026}
}