中文

面向大语言模型攻击的循环翻译防御

计算与语言 2025-05-01 v2 人工智能

摘要

大语言模型(LLM)容易受到需要高水平理解才能抵御的人类可解释攻击。现有防御措施最多只能缓解不到一半的攻击。为此,我们提出了循环翻译(RTT)方法,即首个专为防御 LLM 社交工程攻击而设计的算法。RTT 对对抗性提示进行改写,并概括所传递的观点,使其更容易被 LLM 检测诱导性有害行为。该方法通用、轻量且可移植到不同的 LLM。我们的防御成功缓解了超过 70%的 Prompt Automatic Iterative Refinement(PAIR)攻击,这是目前最有效的防御之一。我们还首次尝试缓解 MathsAttack,并将其攻击成功率降低了近 40%。我们的代码已公开于 https://github.com/Cancanxxx/Round_Trip_Translation_Defence。

关键词

引用

@article{arxiv.2402.13517,
  title  = {Round Trip Translation Defence against Large Language Model Jailbreaking Attacks},
  author = {Canaan Yung and Hadi Mohaghegh Dolatabadi and Sarah Erfani and Christopher Leckie},
  journal= {arXiv preprint arXiv:2402.13517},
  year   = {2025}
}

备注

6 pages, 6 figures