xbench:基于专业对齐的真实世界评估用于跟踪智能体生产力扩展
机器学习
2025-06-17 v1
摘要
我们介绍 xbench,这是一个动态的、专业对齐的评估套件,旨在弥合 AI 智能体能力与实际生产力之间的差距。虽然现有基准通常侧重于孤立的技术技能,但可能不准确反映智能体在专业环境中所提供的经济价值。为此,xbench 针对具有商业意义的领域,由行业专业人员定义评估任务。我们的框架创建与生产力价值高度相关的指标,支持技术-市场适配性(TMF)的预测,并便于随时间跟踪产品能力。作为初始实现,我们呈现两个基准:招聘和营销。在招聘领域,我们收集了来自真实招聘业务场景的 50 个任务,以评估智能体在公司映射、信息检索和人才 sourcing 方面的能力。在营销领域,我们评估智能体将意见领袖匹配到广告商需求的能力,通过一个精选的 836 位潜在意见领袖的池子来评估其在 50 项广告商需求上的表现。我们呈现了针对当代领先智能体的初始评估结果,为这些专业领域建立了基准。我们持续更新的评估集和评估可在 https://xbench.org 获取。
引用
@article{arxiv.2506.13651,
title = {xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations},
author = {Kaiyuan Chen and Yixin Ren and Yang Liu and Xiaobo Hu and Haotong Tian and Tianbao Xie and Fangfu Liu and Haoye Zhang and Hongzhang Liu and Yuan Gong and Chen Sun and Han Hou and Hui Yang and James Pan and Jianan Lou and Jiayi Mao and Jizheng Liu and Jinpeng Li and Kangyi Liu and Kenkun Liu and Rui Wang and Run Li and Tong Niu and Wenlong Zhang and Wenqi Yan and Xuanzheng Wang and Yuchen Zhang and Yi-Hsin Hung and Yuan Jiang and Zexuan Liu and Zihan Yin and Zijian Ma and Zhiwen Mo},
journal= {arXiv preprint arXiv:2506.13651},
year = {2025}
}
备注
Project page: https://xbench.org