合并技术提升自我批判能力以抵御越狱攻击
计算与语言
2024-07-16 v2 人工智能
摘要
大型语言模型 (LLM) 针对对抗性操纵,如越狱攻击的鲁棒性仍是一大挑战。本文提出一种方法,增强 LLM 的自我批判能力,并通过在经过净化合成数据微调来进一步提升其鲁棒性。具体做法是引入可与原始模型合并的外部批判模型,从而增强自我批判能力,提高 LLM 对对抗性提示的鲁棒性。我们的实验结果表明,合并技术与自我批判相结合,可显著降低攻击者的成功率,为抵御越狱攻击提供了有前景的防御机制。代码、数据和模型已发布于 https://github.com/vicgalle/merging-self-critique-jailbreaks。
引用
@article{arxiv.2406.07188,
title = {Merging Improves Self-Critique Against Jailbreak Attacks},
author = {Victor Gallego},
journal= {arXiv preprint arXiv:2406.07188},
year = {2024}
}
备注
Published at ICML 2024 Workshop on Foundation Models in the Wild