拒绝背后:通过行为监控确定护栏激活
密码学与安全
2026-07-02 v1 人工智能
摘要
随着大型语言模型(LLM)和智能体系统融入实际应用,确保其安全性和可靠性至关重要。检测并阻止发送至 LLM 及从 LLM 发出的恶意指令的护栏系统是 AI 安全的重要组成部分。然而,针对生产级 AI 系统进行黑盒对抗模拟的研究人员,往往难以确定是护栏拦截还是 LLM 自身拒绝。这一区别至关重要,因为绕过护栏的技术与绕过 LLM 安全对齐的技术可能大相径庭,并对攻击技术的选择和优化产生实质性影响。我们提出了首个黑盒护栏侦察方法,该方法通过监控 HTTP、词汇和时序信号来检测目标 AI 系统中是否存在护栏,仅假设黑盒访问权限且对护栏或 AI 系统零先验知识。实验表明,我们的方法检测护栏存在的准确率达到 100%,良性交互与恶意交互之间存在统计学上显著的行为分离(q < 0.001)。我们的方法还能识别护栏旨在阻止的内容类别,并在未见提示上以平均 F1 分数 98% 的准确率区分护栏拦截与 LLM 拒绝。
引用
@article{arxiv.2607.02121,
title = {Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring},
author = {William Hackett and Peter Garraghan},
journal= {arXiv preprint arXiv:2607.02121},
year = {2026}
}
备注
19 pages, 13 figures, 4 tables