基于注意力感知图神经网络的多轮 LLM 越狱输入防御:G-Guard
机器学习
2025-10-15 v2 计算与语言
摘要
大型语言模型(LLM)在 various applications 中获得了广泛关注,但其能力也为建设性和恶意用途都带来了风险。尽管经过大量训练和微调以增强安全性,但 LLM 仍然容易遭受越狱攻击。近期,多轮攻击的出现加剧了这一脆弱性。与单轮攻击不同,多轮攻击会逐步增加对话复杂度,使其更难检测和缓解。本研究引入 G-Guard,一种创新的注意力感知图神经网络(GNN)输入分类器,专为防御针对 LLM 的多轮越狱攻击而设计。G-Guard 为多轮查询构建实体图,该图捕捉查询与在多轮查询中出现的有害关键词之间的相互关系。进一步,我们提出一种注意力感知数据增强机制,基于 ongoing 的多轮对话检索最相关的单轮查询。检索到的查询作为带标签的节点纳入图中,从而增强 GNN 对当前查询为有害或良性的分类能力。评估结果表明,G-Guard 在 diverse 数据集和 evaluation 指标上均优于所有基线方法,证明其作为防御多轮越狱攻击的 robust 机制具有有效性。
引用
@article{arxiv.2507.07146,
title = {Attention-Aware GNN-based Input Defense against Multi-Turn LLM Jailbreak},
author = {Zixuan Huang and Kecheng Huang and Lihao Yin and Bowei He and Huiling Zhen and Mingxuan Yuan and Zili Shao},
journal= {arXiv preprint arXiv:2507.07146},
year = {2025}
}