中文

EnterpriseBench Corecraft:在高保真 RL 环境中训练通用智能体

人工智能 2026-03-03 v5 机器学习

摘要

我们表明,在高保真强化学习环境中训练的 AI 智能体能够产生超越训练分布的能力。我们引入了 CoreCraft,这是 EnterpriseBench 系列中第一个环境,Surge AI 的一套 agentic RL 环境。CoreCraft 是一个完整的客户支持组织仿真系统,包含超过 2,500 个实体、14 种实体类型和 23 种独特工具,旨在衡量 AI 智能体是否能够执行真实工作所需的多步骤、领域特定的工作。诸如 GPT-5.2 和 Claude Opus 4.6 等前沿模型在必须满足所有专家编写的 rubric 准则时,解决 fewer than 30% 的任务。使用该环境,我们使用 Group Relative Policy Optimization (GRPO) 和自适应裁剪训练 GLM 4.6。经过单个纪元的训练后,该模型在 held-out 评估任务上的通过率从 25.37% 提升到 36.76%。更重要的是,这些收益transfer 到 out-of-distribution 基准测试:在 BFCL Parallel 上提升 4.5%,在 Tau2-Bench Retail 上提升 7.4%,在 Tool Decathlon (Pass@1) 上提升 6.8%。我们认为,以下三种环境属性与观察到的 transfer 现象相符:以任务为中心的世界构建以优化多样化、具有挑战性的任务为目标;专家编写的 rubrics 实现可靠的奖励计算;企业工作流程反映了真实专业模式。我们的结果表明,环境的质量、多样性和真实性是实现通用智能体能力的关键因素。

关键词

引用

@article{arxiv.2602.16179,
  title  = {EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments},
  author = {Sushant Mehta and Logan Ritchie and Suhaas Garre and Ian Niebres and Nick Heiner and Edwin Chen},
  journal= {arXiv preprint arXiv:2602.16179},
  year   = {2026}
}