中文

Foot-In-The-Door:面向LLM的多轮越狱方法

计算与语言 2025-03-31 v3 人工智能

摘要

随着大型语言模型越来越多地融入实际应用,确保AI安全至关重要。一个关键挑战是越狱,即对抗性提示绕过内置的安全措施,以产生有害的不允许的输出。灵感来自心理学的脚在门原则,我们提出了FITD,这是一种新型的多轮越狱方法,利用次要初始承诺降低对更大或更不道德越轨的阻力。我们的方法通过中间桥接提示逐步升级恶意意图,并通过自身对模型响应进行对齐以诱导有毒反应。对两个越狱基准的大量实验结果表明,FITD在七个广泛使用的模型上实现了94%的平均攻击成功率,超越了现有的状态-of-the-art方法。此外,我们提供了对LLM自腐化的深入分析,突显了当前对齐策略的漏洞,并强调了多轮交互中固有的风险。代码可在https://github.com/Jinxiaolong1129/Foot-in-the-door-Jailbreak获取。

关键词

引用

@article{arxiv.2502.19820,
  title  = {Foot-In-The-Door: A Multi-turn Jailbreak for LLMs},
  author = {Zixuan Weng and Xiaolong Jin and Jinyuan Jia and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2502.19820},
  year   = {2025}
}

备注

19 pages, 8 figures