中文

合并技术提升自我批判能力以抵御越狱攻击

计算与语言 2024-07-16 v2 人工智能

摘要

大型语言模型 (LLM) 针对对抗性操纵,如越狱攻击的鲁棒性仍是一大挑战。本文提出一种方法,增强 LLM 的自我批判能力,并通过在经过净化合成数据微调来进一步提升其鲁棒性。具体做法是引入可与原始模型合并的外部批判模型,从而增强自我批判能力,提高 LLM 对对抗性提示的鲁棒性。我们的实验结果表明,合并技术与自我批判相结合,可显著降低攻击者的成功率,为抵御越狱攻击提供了有前景的防御机制。代码、数据和模型已发布于 https://github.com/vicgalle/merging-self-critique-jailbreaks。

关键词

引用

@article{arxiv.2406.07188,
  title  = {Merging Improves Self-Critique Against Jailbreak Attacks},
  author = {Victor Gallego},
  journal= {arXiv preprint arXiv:2406.07188},
  year   = {2024}
}

备注

Published at ICML 2024 Workshop on Foundation Models in the Wild