中文

MirrorShield:通过熵引导镜像构建迈向针对越狱的通用防御

密码学与安全 2025-05-21 v2 人工智能

摘要

防御大型语言模型(LLM)免受越狱攻击对于确保其安全部署至关重要。现有的防御策略通常依赖预定义的静态标准来区分有害和良性提示。然而,这种僵化的规则无法适应现实世界越狱攻击固有的复杂性和动态性。在本文中,我们关注针对多样化越狱的通用防御这一新颖挑战。我们提出了一个新概念“镜像”,它是一个动态生成的提示,反映输入的句法结构同时确保语义安全。输入提示及其对应镜像之间的差异作为防御的指导原则。进一步提出了一种新颖的防御模型 MirrorShield,基于构建的镜像来检测和校准风险输入。在多个基准数据集上进行评估并与十种 SOTA 攻击方法进行比较,MirrorShield 展现了卓越的防御性能和有前景的泛化能力。

关键词

引用

@article{arxiv.2503.12931,
  title  = {MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting},
  author = {Rui Pu and Chaozhuo Li and Rui Ha and Litian Zhang and Lirong Qiu and Xi Zhang},
  journal= {arXiv preprint arXiv:2503.12931},
  year   = {2025}
}