利用自评估防御针对 LLM 的对抗攻击
机器学习
2024-08-07 v3 计算与语言
密码学与安全
摘要
我们引入了一种利用自评估来防御针对 LLM 对抗攻击的方法。我们的方法不需要模型微调,而是使用预训练模型来评估生成模型的输入与输出,与其他基于微调的方法相比,显著降低了实现成本。我们的方法能够显著降低针对开源和闭源 LLM 攻击的攻击成功率,其降低幅度超过了 Llama-Guard2 和常用的内容审查 API 所展示的效果。我们对方法的有效性进行了分析,包括在各种设置下攻击评估器的尝试,证明它也比现有方法对攻击更具鲁棒性。代码和数据将发布于 https://github.com/Linlt-leon/self-eval。
引用
@article{arxiv.2407.03234,
title = {Self-Evaluation as a Defense Against Adversarial Attacks on LLMs},
author = {Hannah Brown and Leon Lin and Kenji Kawaguchi and Michael Shieh},
journal= {arXiv preprint arXiv:2407.03234},
year = {2024}
}
备注
8 pages, 7 figures