中文

上下文误导性地破坏LLM的安全对齐:基于上下文过滤的防御机制

密码学与安全 2025-08-15 v1 人工智能 计算与语言

摘要

尽管大语言模型(LLM)在性能方面取得了显著的进展,但各种越狱攻击已带来日益增长的安全和伦理风险。恶意用户常常利用对抗性上下文来欺骗LLM,从而让其针对有害查询生成响应。本研究提出了一种新的防御机制,称为上下文过滤模型,是一种 designed to filter out 不可信和不可靠的上下文,同时识别包含真实用户意图的主要提示,以揭露隐藏的恶意意图。鉴于增强LLM安全性通常会损害其帮助fulness,从而可能影响良性用户的体验,我们的方法旨在提高LLM的安全性,同时保持其原始性能。我们通过比较分析评估了模型在防御越狱攻击方面的效果,通过与针对六种不同攻击的先进防御机制进行比较,评估了这些防御措施下的LLM帮助fulness。我们的模型显示,能够将越狱攻击的攻击成功率降低最高可达88%,同时保持原始LLM的性能,在安全性和帮助fulness方面实现了最佳结果。值得注意的是,我们的模型是一种即插即用方法,可应用于所有LLM,包括白盒模型和黑盒模型,以无需对模型本身进行任何微调即可提升其安全性。我们将公开发布该模型供研究人员使用。

关键词

引用

@article{arxiv.2508.10031,
  title  = {Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs},
  author = {Jinhwa Kim and Ian G. Harris},
  journal= {arXiv preprint arXiv:2508.10031},
  year   = {2025}
}

备注

13 pages, 2 figures