面向大语言模型驱动的黑盒表格智能体的演化注入攻击——StruPhantom
密码学与安全
2025-04-15 v1 人工智能
摘要
大语言模型(LLM)驱动的自主智能体已在处理表格数据的热门商业应用中取得了革命性的进展。尽管观察到LLM对来自外部数据源的提示注入攻击具有脆弱性,但表格智能体对攻击者的有效载荷实施了严格的数据格式和预定义规则的约束,除非智能体导航多个结构数据层级才能将其整合。为解决这一挑战,我们提出了一种新型攻击——StruPhantom,专针对黑盒LLM驱动的表格智能体。我们的攻击设计了一种演化优化程序,通过提出的受约束蒙特卡洛树搜索(Monte Carlo Tree Search)并配合离题评估器(off-topic evaluator)不断细化攻击有效载荷。StruPhantom帮助系统性地探索和利用目标应用的弱点,以实现目标劫持。我们的评估验证了StruPhantom在各种LLM-based智能体上的有效性,包括真实平台上的智能体和攻击场景。我们的攻击在强制应用程序的响应包含钓鱼链接或恶意代码时,成功率比基线高超过50%。
引用
@article{arxiv.2504.09841,
title = {StruPhantom: Evolutionary Injection Attacks on Black-Box Tabular Agents Powered by Large Language Models},
author = {Yang Feng and Xudong Pan},
journal= {arXiv preprint arXiv:2504.09841},
year = {2025}
}
备注
Work in Progress