狱中之越狱者:面向大语言模型的移动目标防御
密码学与安全
2023-10-05 v1
摘要
大语言模型(LLMs)以理解和遵循指令的能力著称,但易受对抗攻击。研究者发现,当前商业 LLMs 在面对对抗查询时,要么因给出不道德回答而未能做到“无害”,要么因拒绝提供有意义回答而未能做到“有用”。为在有用与无害之间取得平衡,我们设计了一个移动目标防御(MTD)增强的 LLM 系统。该系统旨在提供与多个模型候选输出一致的无毒回答,从而使其对对抗攻击更具鲁棒性。我们设计了一个查询与输出分析模型,以过滤掉不安全或无响应的回答。我们使用 8 个最新聊天机器人模型与 SOTA 对抗查询进行了评估。我们的 MTD 增强 LLM 系统将攻击成功率从 37.5% 降至 0%,同时将拒绝响应率从 50% 降至 0%。
引用
@article{arxiv.2310.02417,
title = {Jailbreaker in Jail: Moving Target Defense for Large Language Models},
author = {Bocheng Chen and Advait Paliwal and Qiben Yan},
journal= {arXiv preprint arXiv:2310.02417},
year = {2023}
}
备注
MTD Workshop in CCS'23