中文

模仿熟悉之物:LLM工具学习系统中信息窃取攻击的动态命令生成

人工智能 2025-02-18 v1 密码学与安全

摘要

信息窃取攻击对大型语言模型(LLM)工具学习系统构成重大威胁。攻击者可通过被入侵的工具注入恶意命令,操纵LLM向这些工具发送敏感信息,从而导致潜在的隐私泄露。然而,现有攻击方法面向黑盒,依赖无法灵活适应用户查询变化和工具调用链变化的静态命令。这使得恶意命令更容易被LLM检测到,导致攻击失败。本工作提出AutoCMD,一种面向LLM工具学习系统中信息窃取攻击的动态攻击命令生成方法。受模仿熟悉之物概念的启发,AutoCMD能够通过在开源系统上学习并结合目标系统示例进行强化,推断工具链中上游工具所利用的信息,从而生成更具针对性的窃取命令。评估结果表明AutoCMD相比基线取得了+13.2%的ASRTheftASR_{Theft}提升,并且能够泛化至新的工具学习系统以暴露其信息泄露风险。我们还设计了四种防御方法,以有效保护工具学习系统免受攻击。

关键词

引用

@article{arxiv.2502.11358,
  title  = {Mimicking the Familiar: Dynamic Command Generation for Information Theft Attacks in LLM Tool-Learning System},
  author = {Ziyou Jiang and Mingyang Li and Guowei Yang and Junjie Wang and Yuekai Huang and Zhiyuan Chang and Qing Wang},
  journal= {arXiv preprint arXiv:2502.11358},
  year   = {2025}
}

备注

15 pages, 11 figures