“越狱”在大多数情况下比你想象的更简单
密码学与安全
2025-03-10 v1 人工智能
摘要
我们引入情境合规攻击(CCA),一种新型、无需优化的方法,用于绕过AI安全机制。不同于当前方法——这些方法依赖复杂的提示工程和计算密集的优化——CCA利用许多部署AI系统固有的根本性架构漏洞。通过微调对话历史,CCA说服模型遵循虚构的对话上下文,从而触发受限行为。我们在多样化的开源和专有模型上进行评估,证明这种简单的攻击能够绕过最先进的安全协议。我们讨论了这些发现的含义,并提出了实用性的缓解策略,以强化AI系统免受此类基础且有效的对抗性策略的防御。
引用
@article{arxiv.2503.05264,
title = {Jailbreaking is (Mostly) Simpler Than You Think},
author = {Mark Russinovich and Ahmed Salem},
journal= {arXiv preprint arXiv:2503.05264},
year = {2025}
}