中文

狱中之越狱者:面向大语言模型的移动目标防御

密码学与安全 2023-10-05 v1

摘要

大语言模型(LLMs)以理解和遵循指令的能力著称,但易受对抗攻击。研究者发现,当前商业 LLMs 在面对对抗查询时,要么因给出不道德回答而未能做到“无害”,要么因拒绝提供有意义回答而未能做到“有用”。为在有用与无害之间取得平衡,我们设计了一个移动目标防御(MTD)增强的 LLM 系统。该系统旨在提供与多个模型候选输出一致的无毒回答,从而使其对对抗攻击更具鲁棒性。我们设计了一个查询与输出分析模型,以过滤掉不安全或无响应的回答。我们使用 8 个最新聊天机器人模型与 SOTA 对抗查询进行了评估。我们的 MTD 增强 LLM 系统将攻击成功率从 37.5% 降至 0%,同时将拒绝响应率从 50% 降至 0%。

关键词

引用

@article{arxiv.2310.02417,
  title  = {Jailbreaker in Jail: Moving Target Defense for Large Language Models},
  author = {Bocheng Chen and Advait Paliwal and Qiben Yan},
  journal= {arXiv preprint arXiv:2310.02417},
  year   = {2023}
}

备注

MTD Workshop in CCS'23