中文

对真实场景对话的大规模分析揭示 LLM 越狱的复杂度界限

计算与语言 2026-05-28 v1 人工智能 计算机与社会

摘要

随着大型语言模型的日益广泛部署,理解越狱策略的复杂度及其演变对 AI 安全至关重要。我们对来自不同平台(包括专门的越狱社区和通用聊天机器人)的超过 200 万次真实世界对话进行了大规模的越狱复杂度实证分析。使用涵盖概率测度、词汇多样性、压缩率和认知负荷指标的一系列复杂度指标,我们发现越狱尝试并未表现出比正常对话显著更高的复杂度。这一模式在专门的越狱社区和普通用户群体中均保持一致,表明攻击复杂度存在实际界限。时间分析显示,尽管用户攻击的毒性和复杂度随时间保持稳定,但助手响应的毒性有所下降,表明安全机制正在改善。复杂度分布中缺乏幂律缩放进一步表明越狱发展存在自然界限。我们的发现挑战了攻击者与防御者之间不断升级的军备竞赛这一普遍说法,反而表明 LLM 安全性的演变受限于人类创造力约束,而防御措施仍在继续进步。我们的结果突显了学术越狱披露中的关键信息风险,因为超过当前复杂度基线的复杂攻击可能会打破观察到的平衡,并在防御适应之前造成广泛的危害。

关键词

引用

@article{arxiv.2507.08014,
  title  = {Mass-Scale Analysis of In-the-Wild Conversations Reveals Complexity Bounds on LLM Jailbreaking},
  author = {Aldan Creo and Raul Castro Fernandez and Manuel Cebrian},
  journal= {arXiv preprint arXiv:2507.08014},
  year   = {2026}
}

备注

Code: https://github.com/ACMCMC/risky-conversations Results: https://huggingface.co/risky-conversations Visualizer: https://huggingface.co/spaces/risky-conversations/Visualizer