中文

基于轨迹的 Clawdbot(OpenClaw)安全审计

密码学与安全 2026-02-17 v1 人工智能

摘要

Clawdbot 是一个自托管、能够使用工具的个人 AI 代理,其动作空间涵盖本地执行和 web 中介工作流程,带来了在模糊性和对抗引导下的安全性和安全性 concerns。我们对 Clawdbot 在六个风险维度上的轨迹进行中心化评估。我们的测试套件从先前的 agent-safety 基准(包括 ATBench 和 LPS-Bench)中抽取并轻度调整情景, supplemented with 量身定制的案例以适应 Clawdbot 的工具表面。我们记录完整的交互轨迹(消息、动作、工具调用参数/输出),并使用自动轨迹评估器(AgentDoG-Qwen3-4B)和人工审查相结合的方式评估安全性。在 34 个标准案例中,我们发现其安全性轮廓呈非均匀分布:在以可靠性为导向的任务上表现通常是一致的,而大多数失败发生在意图不明确、目标开放式或看似善意的越狱提示下,此时微小的误解可能导致更高影响力的工具动作。我们补充了整体结果的代表性案例研究,概述了这些案例的共性,分析了 Clawdbot 在实际应用中容易触发的安全漏洞和典型失效模式。

关键词

引用

@article{arxiv.2602.14364,
  title  = {A Trajectory-Based Safety Audit of Clawdbot (OpenClaw)},
  author = {Tianyu Chen and Dongrui Liu and Xia Hu and Jingyi Yu and Wenjie Wang},
  journal= {arXiv preprint arXiv:2602.14364},
  year   = {2026}
}