DualView:防止个人 AI 代理中的间接提示注入
密码学与安全
2026-07-04 v1 人工智能
摘要
在用户本地机器上运行的个人 AI 代理(如 OpenClaw)可自动化日常任务,包括网络搜索、电子邮件和文件管理。它们对计算机资源(包括网络、文件系统和 shell)的访问使其面临间接提示注入(IPI)攻击。先前的 Dual LLM 防御通过用代理可以引用但不能读取的符号替换不可信数据来阻止 IPI。然而,它们仅在代理的上下文内跟踪不可信数据,因此当代理保存并稍后重新读取不可信数据时,该数据(可能是攻击者的提示)可以作为可信数据而不是符号返回,我们称之为存储的 IPI。在用户真实环境(人类和程序共享)中操作正是使 OpenClaw 等代理实用的原因,也正是忽略这一点的防御不完整的原因。在这样的环境中保留符号很困难,因为人类和程序需要原始数据。我们提出了 DualView,它将不可信数据跟踪从代理的上下文扩展到用户的环境,包括文件系统、shell、网络和其他代理,通过为每个通道提供两个视图。在 AgentView 中,代理即使在写出并读回数据后也将不可信数据视为符号,从而阻止存储的 IPI,而 HumanView 为人类和工具保留原始数据。DualView 将每个工具调用路由到正确的视图,并跨两个视图同步数据。DualView 仅使用工具钩子作为 OpenClaw 插件部署,无需更改代理的工具调用逻辑或工具实现。由于 DualView 通过设计隔离不可信数据,其保护不限于已知的攻击模板。在我们对 IPI 基准和 PinchBench 的评估中,DualView 阻止了所有 IPI 攻击,包括存储的 IPI,同时保持效用接近未受保护的基线。
引用
@article{arxiv.2607.03821,
title = {DualView: Preventing Indirect Prompt Injection in Personal AI Agents},
author = {Juhee Kim and Woohyuk Choi and Taehyun Kang and Youngmin Kim and Byoungyoung Lee},
journal= {arXiv preprint arXiv:2607.03821},
year = {2026}
}