中文

ClawsBench:在模拟工作空间中评估LLM生产力智能体的能力与安全性

人工智能 2026-04-09 v2

摘要

大语言模型(LLM)智能体越来越多地被部署用于自动化生产力任务(如电子邮件、日程安排、文档管理),但在实时服务上评估它们存在风险,因为可能导致不可逆的更改。现有基准依赖简化环境,无法捕捉真实、有状态、多服务的workflows。我们引入了ClawsBench,一个用于在真实生产力环境中评估和改进LLM智能体的基准。它包含五个高保真模拟服务(Gmail、Slack、Google Calendar、Google Docs、Google Drive),具有完整的状态管理和确定性快照/恢复功能,以及44个结构化任务,涵盖单服务、跨服务和安全性关键场景。我们将智能体框架分解为两个独立杠杆(通过渐进式披露注入API知识的领域技能,以及协调跨服务行为的元提示),并变化两者以测量它们的单独和联合效应。在6个模型、4个智能体框架和33种条件下的实验表明,在完整框架下,智能体实现了39-64%的任务成功率,但表现出7-33%的不安全操作率。在OpenClaw上,排名前五的模型在任务成功率上落在10个百分点的区间内(53-63%),不安全操作率为7%至23%,且两个指标之间没有一致的排序。我们识别出八种反复出现的不安全行为模式,包括多步沙箱升级和静默合同修改。我们在https://clawsbench.com发布了轨迹和未来的数据集。

关键词

引用

@article{arxiv.2604.05172,
  title  = {ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces},
  author = {Xiangyi Li and Kyoung Whan Choe and Yimin Liu and Xiaokun Chen and Chujun Tao and Bingran You and Wenbo Chen and Zonglin Di and Jiankai Sun and Shenghan Zheng and Jiajun Bao and Yuanli Wang and Weixiang Yan and Yiyuan Li and Han-chung Lee},
  journal= {arXiv preprint arXiv:2604.05172},
  year   = {2026}
}

备注

25 pages, 5 figures