中文

基于安全上下文检索的面向实际威胁的可扩展防御机制

密码学与安全 2025-05-22 v1 人工智能 计算与语言 机器学习

摘要

大型语言模型(LLM)已知对越狱攻击高度脆弱,攻击者会利用精心设计的提示来诱发有害或不道德的响应。此类威胁引发了对 LLM 在实际部署中安全性和可靠性的严重关切。虽然现有防御机制部分缓解了此类风险,但随着对抗技术的不断发展,新的越狱方法已能够规避这些保护,暴露了静态防御框架的局限性。本文通过检索上下文的视角来防御不断演化的越狱威胁。首先,我们进行了初步研究,表明即使针对特定越狱的最小安全对齐示例集合,也能显著提升对该攻击模式的鲁棒性。基于此洞见,我们进一步利用检索增强生成(RAG)技术,提出 Safety Context Retrieval (SCR),一种面向 LLM 防御越狱的可扩展且鲁棒的保护范式。我们的全面实验表明,SCR 在抵御既定及新兴的越狱战术方面实现了卓越的防御性能,为 LLM 安全贡献了新的范式。我们的代码将在发表后提供。

关键词

引用

@article{arxiv.2505.15753,
  title  = {Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval},
  author = {Taiye Chen and Zeming Wei and Ang Li and Yisen Wang},
  journal= {arXiv preprint arXiv:2505.15753},
  year   = {2025}
}