你的代理,我的资产:面向 OpenClaw 的真实世界安全分析
密码学与安全
2026-04-07 v1 人工智能
计算与语言
摘要
OpenClaw 是 2026 年初最广泛部署的个人 AI 代理,拥有完整的本地系统访问权限,并集成了诸如 Gmail、Stripe 和文件系统等敏感服务。虽然这些广泛的权限 enable 了高度的自动化和强大的个性化,但也暴露了 substantial 的攻击面,现有的沙箱评估未能捕获。为弥合这一差距,我们present首个针对 OpenClaw 的真实世界安全评估,并引入 CIK 框架,将代理的持久状态统一分为三个维度,即能力(Capability)、身份(Identity)和知识(Knowledge),用于安全分析。我们的评估覆盖 12 个攻击情景,针对活跃的 OpenClaw 实例进行测试,涵盖四个基础模型(Claude Sonnet 4.5、Opus 4.6、Gemini 3.1 Pro 和 GPT-5.4)。结果表明,中毒任何单个 CIK 维度都会将平均攻击成功率从 24.6% 提升至 64-74%,即使是最稳健的模型也比其基线脆弱性高出三倍以上。我们进一步评估了三个 CIK 对齐的防御策略以及文件保护机制;然而,最强的防御在针对能力导向的攻击下仍仍 yield 63.8% 的成功率,而文件保护可阻挡 97% 的恶意注入,但也会阻止合法更新。综合这些发现表明,脆弱性本质上源于代理体系结构, necessitating 更系统的 safeguard 来 secure 个人 AI 代理。
引用
@article{arxiv.2604.04759,
title = {Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw},
author = {Zijun Wang and Haoqin Tu and Letian Zhang and Hardy Chen and Juncheng Wu and Xiangyan Liu and Zhenlong Yuan and Tianyu Pang and Michael Qizhe Shieh and Fengze Liu and Zeyu Zheng and Huaxiu Yao and Yuyin Zhou and Cihang Xie},
journal= {arXiv preprint arXiv:2604.04759},
year = {2026}
}