使用显式有害提示越狱商用黑盒 LLM
计算与语言
2026-01-08 v3 密码学与安全
摘要
现有的黑盒越狱攻击在非推理模型上取得了一定成功,但在最近的 SOTA 推理模型上效果显著下降。为了提高攻击能力,受对抗性聚合策略的启发,我们将多种越狱技巧整合到一个开发者模板中。特别地,我们应用对抗性上下文对齐 (Adversarial Context Alignment) 来清除语义不一致,并使用基于 NTP(一种有害提示)的少样本示例来引导恶意输出,最终形成带有虚假思维链的 DH-CoT 攻击。在实验中,我们进一步观察到现有的红队测试数据集包含不适合评估攻击增益的样本,例如 BP、NHP 和 NTP。这些数据阻碍了对真实攻击效果提升的准确评估。为解决此问题,我们引入了 MDH,一个融合了基于 LLM 的标注与人工辅助的恶意内容检测框架,利用该框架我们清洗数据并构建了 RTA 数据集套件。实验表明,MDH 能可靠地过滤低质量样本,而 DH-CoT 能有效越狱包括 GPT-5 和 Claude-4 在内的模型,显著优于 H-CoT 和 TAP 等 SOTA 方法。
引用
@article{arxiv.2508.10390,
title = {Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts},
author = {Chiyu Zhang and Lu Zhou and Xiaogang Xu and Jiafei Wu and Liming Fang and Zhe Liu},
journal= {arXiv preprint arXiv:2508.10390},
year = {2026}
}