中文

基于知识图的黑盒防御框架KG-DF以应对越狱攻击

密码学与安全 2025-11-12 v1 人工智能

摘要

大型语言模型(LLM)在各领域的广泛应用带来了日益突出的安全挑战,尤其是越狱问题。这些攻击通过精心构造的输入诱导模型生成错误或不可控制的输出,威胁模型的通用性和安全性。虽然现有防御方法显示出一定效果,但往往难以在模型通用性和安全性之间取得平衡。防御过度可能限制模型的正常使用,而防御不足则可能导致安全漏洞。为此,我们提出了知识图防御框架(Knowledge Graph Defense Framework, KG-DF)。具体而言,由于其结构化知识表示和语义关联能力,知识图(Knowledge Graph, KG)可以通过将输入内容与知识库中的安全知识关联来进行搜索,从而识别潜在的有害意图并提供安全的推理路径。然而,传统KG方法在面对多样化和不断演变的攻击策略时,在关键词提取方面面临重大挑战。为此,我们引入了可扩展的语义解析模块,其核心任务是将输入查询转换为一组结构化和安全的概念表示,从而增强匹配过程的相关性。实验结果表明,我们的框架在各种越狱攻击方法上提高了防御性能,同时通过纳入领域通用知识也提高了LLM在一般问答场景中的响应质量。

关键词

引用

@article{arxiv.2511.07480,
  title  = {KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs},
  author = {Shuyuan Liu and Jiawei Chen and Xiao Yang and Hang Su and Zhaoxia Yin},
  journal= {arXiv preprint arXiv:2511.07480},
  year   = {2025}
}