TRUSTDESC:通过受信描述生成防止 LLM 应用程序中的工具中毒
密码学与安全
2026-04-10 v1
摘要
大型语言模型 (LLM) 越来越依赖外部工具以执行时间敏感任务和实际行动。虽然工具集成扩展了 LLM 的能力,但也引入了新的 prompt 注入攻击面:工具中毒攻击 (TPA)。攻击者通过在工具描述中嵌入恶意指令 (显式 TPA) 或误导性声明 (隐式 TPA) 来影响模型行为和工具选择。现有防御主要检测异常指令,对隐式 TPA 效果有限。在本文中,我们提出 TRUSTDESC,即防止工具中毒的首个框架,通过自动生成受信工具描述。TRUSTDESC 通过三个阶段的管线从实现生成与之一致的描述。SliceMin 执行可达性感知的静态分析和 LLM 引导的剥离,以提取最小工具相关代码片段。DescGen 从这些片段合成描述,同时减轻误导或对抗性代码痕迹。DynVer 通过执行合成任务并验证行为主张来细化描述。我们在多个工具生态系统中的 52 个真实工具上评估了 TRUSTDESC。结果表明,TRUSTDESC 产生准确的工具描述,提高了任务完成率,同时以最小时间和费用开销抑制了隐式 TPA 的根本源。
引用
@article{arxiv.2604.07536,
title = {TRUSTDESC: Preventing Tool Poisoning in LLM Applications via Trusted Description Generation},
author = {Hengkai Ye and Zhechang Zhang and Jinyuan Jia and Hong Hu},
journal= {arXiv preprint arXiv:2604.07536},
year = {2026}
}