中文

利用自评估防御针对 LLM 的对抗攻击

机器学习 2024-08-07 v3 计算与语言 密码学与安全

摘要

我们引入了一种利用自评估来防御针对 LLM 对抗攻击的方法。我们的方法不需要模型微调,而是使用预训练模型来评估生成模型的输入与输出,与其他基于微调的方法相比,显著降低了实现成本。我们的方法能够显著降低针对开源和闭源 LLM 攻击的攻击成功率,其降低幅度超过了 Llama-Guard2 和常用的内容审查 API 所展示的效果。我们对方法的有效性进行了分析,包括在各种设置下攻击评估器的尝试,证明它也比现有方法对攻击更具鲁棒性。代码和数据将发布于 https://github.com/Linlt-leon/self-eval。

关键词

引用

@article{arxiv.2407.03234,
  title  = {Self-Evaluation as a Defense Against Adversarial Attacks on LLMs},
  author = {Hannah Brown and Leon Lin and Kenji Kawaguchi and Michael Shieh},
  journal= {arXiv preprint arXiv:2407.03234},
  year   = {2024}
}

备注

8 pages, 7 figures