Claw-Eval:面向自主智能体的可信评估
人工智能
2026-05-08 v3
摘要
大型语言模型越来越多地被部署为自主智能体,用于现实世界软件环境中的多步骤工作流。然而,现有的智能体基准测试受到轨迹不透明评分、安全性和鲁棒性评估不明确以及模态和交互范式覆盖范围狭窄的限制。我们引入了 Claw-Eval,这是一个端到端评估套件,通过 300 个经人工验证的任务填补了这些空白,涵盖三个组别的 9 个类别:通用服务编排、多模态感知与交互以及多轮专业对话。为实现轨迹感知评分,每次运行通过三个独立证据通道进行记录:执行轨迹、审计日志和环境快照,生成 2,159 个细粒度评分细则项。评分协议评估完成度、安全性和鲁棒性,通过三次试验的平均分、Pass@k 和 Pass^k 来区分真实能力与运气结果。在 14 个前沿模型上的实验表明:(1)轨迹不透明评估系统性地不可靠,遗漏了我们框架检测到的 44% 的安全性违规和 13% 的鲁棒性失败。(2)能力并不意味着一致性,在误差注入下 Pass@3 保持稳定,而 Pass^3 下降幅度高达 24 个百分点。(3)智能体能力具有强烈的多维度特性,模型排名在不同任务组和指标之间有所变化,表明我们异质性的评估覆盖是必不可少的。Claw-Eval 指出了开发不仅有能力而且可可靠部署的智能体的方向。
引用
@article{arxiv.2604.06132,
title = {Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents},
author = {Bowen Ye and Rang Li and Qibin Yang and Yuanxin Liu and Linli Yao and Hanglong Lv and Zhihui Xie and Chenxin An and Lei Li and Lingpeng Kong and Qi Liu and Zhifang Sui and Tong Yang},
journal= {arXiv preprint arXiv:2604.06132},
year = {2026}
}