中文

通过内容具体化越狱大型语言模型

密码学与安全 2025-09-17 v1 人工智能 计算与语言

摘要

大型语言模型(LLMs)越来越多地被部署用于任务自动化和内容生成,然而其安全机制仍然容易受到不同越狱技术的绕过。本文提出了一种新颖的越狱技术——内容具体化(Content Concretization, CC),该技术迭代地将抽象的恶意请求转化为具体的、可执行的实现。CC是一个两阶段过程:首先,使用层级较低、安全过滤约束较松的模型生成初始LLM响应,然后通过处理初步输出和原始提示的更高层级模型对其进行精炼。我们使用350个网络安全特定提示评估了该技术,结果表明越狱成功率(SRs)显著提高,从7%(无精炼)增加到三次精炼迭代后的62%,同时每次提示的成本保持在7.5美分。在九个不同LLM评估器上的比较A/B测试证实,经过额外精炼步骤的输出被一致评定为更具恶意性且技术上更优。此外,手动代码分析显示,生成的输出只需极少修改即可执行,尽管最佳部署通常需要针对特定目标的微调。随着有害代码生成能力的最终提升,这些结果凸显了当前LLM安全框架中的关键漏洞。

关键词

引用

@article{arxiv.2509.12937,
  title  = {Jailbreaking Large Language Models Through Content Concretization},
  author = {Johan Wahréus and Ahmed Hussain and Panos Papadimitratos},
  journal= {arXiv preprint arXiv:2509.12937},
  year   = {2025}
}

备注

Accepted for presentation in the Conference on Game Theory and AI for Security (GameSec) 2025