中文

“越狱”在大多数情况下比你想象的更简单

密码学与安全 2025-03-10 v1 人工智能

摘要

我们引入情境合规攻击(CCA),一种新型、无需优化的方法,用于绕过AI安全机制。不同于当前方法——这些方法依赖复杂的提示工程和计算密集的优化——CCA利用许多部署AI系统固有的根本性架构漏洞。通过微调对话历史,CCA说服模型遵循虚构的对话上下文,从而触发受限行为。我们在多样化的开源和专有模型上进行评估,证明这种简单的攻击能够绕过最先进的安全协议。我们讨论了这些发现的含义,并提出了实用性的缓解策略,以强化AI系统免受此类基础且有效的对抗性策略的防御。

关键词

引用

@article{arxiv.2503.05264,
  title  = {Jailbreaking is (Mostly) Simpler Than You Think},
  author = {Mark Russinovich and Ahmed Salem},
  journal= {arXiv preprint arXiv:2503.05264},
  year   = {2025}
}