黑箱大语言模型的边界点攻击
机器学习
2026-02-19 v2
摘要
前沿大语言模型 (LLM) 已受到针对通过对抗性提示提取有害信息的“越狱”攻击的保护。最近,防御方开发了经过数千小时人类红队测试的分类器-based 系统。我们引入边界点越狱 (BPJ),这是一种新的自动化越狱攻击类别,能规避最强部署式安全防护。与依赖白/灰箱假设(如分类器得分或梯度)或现有越狱库的先前攻击不同,BPJ 完全是黑箱方法,仅每一次查询提供一个比特信息:分类器是否标记该交互。为实现此目标,BPJ 解决了针对鲁棒真实防御优化攻击的核心难题:评估对攻击提出的修改是否为改进。BPJ 不直接尝试为目标有害字符串学习攻击,而是将该字符串转换为一系列中间攻击目标的课程,然后主动选择最能检测攻击强度小变化的评估点(“边界点”)。我们认为 BPJ 是首个成功开发针对宪法分类器的通用越狱的完全自动化攻击算法,也是首个在不依赖人类攻击种子的情况下成功攻击 GPT-5 输入分类器的自动化攻击算法。BPJ 在单个交互中难以防御,但在优化过程中会触发大量警报,这表明有效防御需要在单次交互方法之外补充批量级监控。
引用
@article{arxiv.2602.15001,
title = {Boundary Point Jailbreaking of Black-Box LLMs},
author = {Xander Davies and Giorgi Giglemiani and Edmund Lau and Eric Winsor and Geoffrey Irving and Yarin Gal},
journal= {arXiv preprint arXiv:2602.15001},
year = {2026}
}