中文

LIAR:借助推理时对齐(Best-of-N)实现秒级攻破 LLM

计算与语言 2025-07-08 v3

摘要

越狱攻击通过精心设计的提示词诱导产生有害输出,从而暴露了安全对齐 LLM 的漏洞。现有方法依赖离散优化或训练对抗生成器,但速度慢、计算密集且往往难以实际应用。我们认为,这些效率问题源于对问题的误表述。我们将越狱定义为推理时错位,并提出 LIAR(Leveraging Inference-time misAlignment to jailbReak),一种快速、黑箱、无需训练的基于 Best-of-N 采样攻击。LIAR 在匹配最新成功率的同时,将困惑度降低 10 倍,将攻击时间从小时缩短至秒。我们还引入了衡量安全对齐强度的理论“安全垫”指标,并推导出次优性界限。本工作提供了一个简单而有效的工具,用于评估 LLM 的鲁棒性并推动对齐研究。

关键词

引用

@article{arxiv.2412.05232,
  title  = {LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds},
  author = {James Beetham and Souradip Chakraborty and Mengdi Wang and Furong Huang and Amrit Singh Bedi and Mubarak Shah},
  journal= {arXiv preprint arXiv:2412.05232},
  year   = {2025}
}