LASH:面向大语言模型黑盒越狱的自适应语义混合
计算与语言
2026-05-21 v1
摘要
越狱攻击暴露了对齐后的大语言模型在对抗性提示下的行为与其既定安全行为之间的持续差距。现有自动化方法日益有效,但每个方法都依赖单一攻击家族(如单次精炼循环、单一树搜索、单一变异空间或单一策略库),且无单一家族占据统治地位:最佳执行方法在不同目标模型和伤害类别间变换,暗示可被 per-prompt 组合所利用的互补优势。我们引入 LASH(LLM Adaptive Semantic Hybridization),一种黑盒框架,将来自多个基准攻击的输出视为可重用的种子提示,针对每个目标请求自适应组合。给定种子池,LASH 在种子子集和 softmax 归一化混合权重之间进行搜索;组合模块综合生成单个候选提示,基于黑盒目标反馈和结合关键词拒绝检测与 LLM 评判评分的两阶段适应函数,遗传优化器更新权重。在 JailbreakBench(包含 100 个跨 10 类的有害提示)上,我们在六个常见目标模型上评估 LASH。LASH 在基于关键词的评估下实现 84.5% 的平均攻击成功率,在两阶段评估下实现 74.5%,后者先过滤拒绝响应,再由 LLM 评判评分是否实质满足原始有害请求。LASH 在两种指标上均优于五种最先进基线,仅用 30 次平均目标查询。LASH 在三种防御机制下仍保持竞争力,并诱导更接近成功的内部表示。这表明跨异构越狱策略的自适应组合是黑盒红队测试的有前景方向。
引用
@article{arxiv.2605.21362,
title = {LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models},
author = {Abdullah Al Nomaan Nafi and Fnu Suya and Swarup Bhunia and Prabuddha Chakraborty},
journal= {arXiv preprint arXiv:2605.21362},
year = {2026}
}