中文

战鼓之声:通过注入引导实现对 OpenClaw 的隐形操控

密码学与安全 2026-03-23 v1 人工智能

摘要

自主编码代理日益融入软件开发工作流程,提供的能力已超越代码建议,延伸至主动系统交互与环境管理。OpenClaw 是这一新兴范式中的代表平台,引入可扩展的技能生态系统,允许第三方开发者通过代理初始化期间的生命周期挂钩注入行为引导。虽然这种设计增强了自动化和自定义能力,但也开辟了一条新型且尚未探索的攻击面。本文识别并系统性地刻画了引导注入,这是一种隐形的攻击向量,通过注入引导文件中的对抗性操作叙事来嵌入恶意行为。不同于传统提示注入依赖显式恶意指令,引导注入通过将有害行为包装为常规最佳实践来操控代理的推理上下文。这些叙事会被自动纳入代理的解释框架,并在不引起警戒的情况下影响未来任务执行。我们构建了26个恶意技能,涵盖13个攻击类别,包括凭证外泄、工作区破坏、特权提升和持久后门安装。我们使用我们开发的 ORE-Bench 进行评估。针对52个自然用户提示和六个最先进的 LLM 后端,我们的攻击实现了16.0%至64.2%的成功率,其中大多数恶意操作是无需用户确认即可自主执行的。此外,94%的恶意技能能通过现有的静态和基于 LLM 的扫描器检测。我们的发现揭示了自主代理生态系统设计中的根本性张力,凸显了基于能力隔离、运行时策略执行和透明引导来源的防御的紧迫需求。

关键词

引用

@article{arxiv.2603.19974,
  title  = {Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance},
  author = {Fazhong Liu and Zhuoyan Chen and Tu Lan and Haozhen Tan and Zhenyu Xu and Xiang Li and Guoxing Chen and Yan Meng and Haojin Zhu},
  journal= {arXiv preprint arXiv:2603.19974},
  year   = {2026}
}