中文

分步推理攻击:揭示大语言模型中‘被抹去’的知识

密码学与安全 2025-06-24 v1 人工智能

摘要

大语言模型 (LLM) 中的知识抹除对于确保数据与 AI 法规合规、保护用户隐私、缓解偏见与误导信息具有重要意义。现有无学习方法旨在提高知识抹除的效率与效果,既删除特定知识又保持整体模型性能,尤其保留信息。然而,观察到无学习技术倾向于压抑并将知识留存于表层,从而通过恰当提示可被召回。本文演示,分步推理可作为一种后门以恢复隐藏信息。我们引入一种基于分步推理的黑盒攻击方法 SLEAK,系统性地暴露无学习失效。我们采用结构化攻击框架,包含三个核心组件:(1) 基于 LLM 生成查询的对抗性提示生成策略,利用分步推理;(2) 成功召回被抹除内容、暴露对保留知识不公平压抑的攻击机制;(3) 将提示分类为直接式、间接式与隐含式,以识别最能利用无学习薄弱环节的查询类型。通过对四种最先进无学习技术及两款广泛使用的 LLM 的广泛评估,我们表明现有方法未能确保可靠的知识移除。其中 62.5% 的生成对抗提示成功召回被抹除的哈利波特事实,而 50% 则暴露了对保留知识的不公平压抑。我们的工作凸显了信息泄露的持续风险,强调需更稳健的无学习策略以实现可靠抹除。

关键词

引用

@article{arxiv.2506.17279,
  title  = {Step-by-Step Reasoning Attack: Revealing 'Erased' Knowledge in Large Language Models},
  author = {Yash Sinha and Manit Baser and Murari Mandal and Dinil Mon Divakaran and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2506.17279},
  year   = {2025}
}