窥探盾牌之后:大语言模型中的护栏识别
密码学与安全
2026-04-14 v2
摘要
随着大语言模型(LLMs)的快速普及,对话式 AI 智能体已广泛部署于现实世界的应用中。为了增强安全性,这些智能体通常配备了用于调节有害内容的护栏。因此,识别智能体中的护栏对于攻击者理解系统并设计针对特定护栏的攻击至关重要。在这项工作中,我们引入了 AP-Test,这是一种利用特定于护栏的对抗性提示来检测部署在黑盒 AI 智能体中的护栏身份的新方法。我们的方法解决了该任务中的关键挑战,包括安全对齐的 LLM 和其他护栏的影响,以及缺乏原则性决策策略的问题。AP-Test 采用两种互补的测试策略,即输入和输出护栏测试,以及一个新的度量标准——匹配分数,以实现稳健的识别。跨多种智能体和四个开源护栏的实验表明,AP-Test 在多种场景下均实现了完美的分类准确率。消融研究进一步凸显了我们所提出组件的必要性。我们的发现揭示了在现实世界 AI 系统中进行护栏识别的一条实用路径。
引用
@article{arxiv.2502.01241,
title = {Peering Behind the Shield: Guardrail Identification in Large Language Models},
author = {Ziqing Yang and Yixin Wu and Rui Wen and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2502.01241},
year = {2026}
}
备注
To Appear in the 64th Annual Meeting of the Association for Computational Linguistics, July 2-7, 2026. ACL Findings