ClawMark:用于多轮、跨日、多模态同事智能体的活生生基准
计算机视觉与模式识别
2026-05-06 v2 软件工程
摘要
语言模型智能体正日益被用作跨多天协助用户的持续性同事。在此类工作流程期间,周围环境可能独立于智能体而发生变化:新邮件到达,日历条目变动,知识库记录被更新,以及证据在图像、扫描 PDF、音频、视频和电子表格中出现。现有基准测试不足以评估此设置,因为它们通常在单个静态情节中运行且高度依赖文本。我们提出 \bench{},一个围绕多轮跨日任务构建的同事智能体基准,包含一个状态驱动的沙盒服务环境,其状态在每轮之间演化,并采用基于规则的验证方法。当前版本包含 100 个跨 13 个专业情景的任务,针对五个状态驱动的沙盒服务(文件系统、邮件、日历、知识库、电子表格)进行测试,由 1537 个确定性 Python 检查器对执行后的服务状态进行评分;评分过程中不调用 LLM 作为评判器。我们对七个前沿智能体系统进行基准测试。最强模型获得 75.8 分的加权得分,但最佳的严格任务成功率仅为 20.0\%,表明部分进展很常见,而完成端到端工作流程仍然罕见。轮次级别的分析显示,在首次外部环境更新后性能下降,凸显了适应变化状态是关键挑战。我们发布基准测试、评估工具 Harness 以及构建管道,以支持可重复的同事智能体评估。
引用
@article{arxiv.2604.23781,
title = {ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents},
author = {Fanqing Meng and Lingxiao Du and Zijian Wu and Guanzheng Chen and Xiangyan Liu and Jiaqi Liao and Chonghe Jiang and Zhenglin Wan and Jiawei Gu and Pengfei Zhou and Rui Huang and Ziqi Zhao and Shengyuan Ding and Ailing Yu and Bo Peng and Bowei Xia and Hao Sun and Haotian Liang and Ji Xie and Jiajun Chen and Jiajun Song and Liu Yang and Ming Xu and Qionglin Qiu and Runhao Fu and Shengfang Zhai and Shijian Wang and Tengfei Ma and Tianyi Wu and Weiyang Jin and Yan Wang and Yang Dai and Yao Lai and Youwei Shu and Yue Liu and Yunzhuo Hao and Yuwei Niu and Jinkai Huang and Jiayuan Zhuo and Zhennan Shen and Linyu Wu and Hannah Yao and Charles Chen and Cihang Xie and Yuyin Zhou and Jiaheng Zhang and Zeyu Zheng and Mengkang Hu and Michael Qizhe Shieh},
journal= {arXiv preprint arXiv:2604.23781},
year = {2026}
}
备注
github repo: https://github.com/evolvent-ai/ClawMark