你让我这么做:测量LLM代理中指令文本引发的私有数据泄露
密码学与安全
2026-03-13 v1 人工智能
摘要
高权限LLM代理被赋予了读取和执行项目指令的能力,因而被广泛信赖来自动化处理任务,同时拥有终端访问权限、文件系统控制权限以及 outbound 网络连接,却获得最少的安全监控。我们识别并系统性地衡量了这一信任模型中的一个根本性漏洞,我们称之为"受信任执行者困境":由于代理无法区分恶意指令与合法设置指导,因而以高速率执行文档嵌入的指令,包括恶意指令。这一漏洞是指令遵循设计范式的结构性结果,绝非实现错误。为结构化我们的衡量,我们 formalized 一个三维范畴,覆盖语言掩饰、结构混淆和语义抽象,并构建了\textbf{ReadSecBench},一个包含500个真实世界README文件的基准,实现可重复评估。在商业部署的计算机使用代理上,实现端到端数据外泄成功率可达85%,在五种编程语言和三个注入位置上保持一致。跨模型评估在四个LLM系列中在仿真环境中确认,语义合规注入指令的行为在模型系列之间保持一致。一项15名参与者的用户研究显示,所有参与者均未检测到任何攻击,且对12类基于规则的防御和6类LLM-based防御的评估显示,两类防御均未实现可靠检测,同时保持可接受的假阳性率。总体而言,这些结果量化了代理功能合规性与其安全意识之间的持久的"语义-安全鸿沟",确立了文档嵌入式指令注入是高权限LLM代理部署中持久且当前未被缓解的威胁。
关键词
引用
@article{arxiv.2603.11862,
title = {You Told Me to Do It: Measuring Instructional Text-induced Private Data Leakage in LLM Agents},
author = {Ching-Yu Kao and Xinfeng Li and Shenyu Dai and Tianze Qiu and Pengcheng Zhou and Eric Hanchen Jiang and Philip Sperl},
journal= {arXiv preprint arXiv:2603.11862},
year = {2026}
}
备注
14 pages