中文

通过语义相关嵌套场景与定向有毒知识越狱大语言模型

密码学与安全 2025-11-18 v2 计算与语言

摘要

大语言模型(LLMs)在各种任务中展现了卓越能力。然而,它们仍然面临越狱攻击,会产生有害响应。嵌套场景策略已在各种方法中被越来越多地采用,展现了巨大潜力。然而,这些方法由于其明显的恶意意图而容易被检测。在这项工作中,我们首次发现并系统验证了大语言模型的对齐防御对嵌套场景不敏感,其中这些场景与查询高度语义相关并融入了定向有毒知识。这是一个至关重要但尚未被充分探索的方向。基于此,我们提出了RTS-Attack(语义相关嵌套场景与定向有毒知识),一个用于检验大语言模型对齐的自适应且自动化的框架。通过构建与查询高度相关的场景并融入定向有毒知识,RTS-Attack绕过了大语言模型的对齐防御。此外,RTS-Attack生成的越狱提示不包含有害查询,从而实现了出色的隐蔽性。大量实验表明,RTS-Attack在效率和通用性方面均优于基线方法,适用于多种先进大语言模型,包括GPT-4o、Llama3-70b和Gemini-pro。我们的完整代码可在https://github.com/nercode/Work获取。警告:本文包含潜在有害内容。

关键词

引用

@article{arxiv.2510.01223,
  title  = {Jailbreaking LLMs via Semantically Relevant Nested Scenarios with Targeted Toxic Knowledge},
  author = {Ning Xu and Bo Gao and Hui Dou},
  journal= {arXiv preprint arXiv:2510.01223},
  year   = {2025}
}