中文

锚定:缓解智能体基准生成中的制件漂移

人工智能 2026-05-27 v1

摘要

AI 智能体开始完成有价值的、长期范围的商业运营任务,但企业工作的训练和评估环境仍在现实性、可验证性和规模之间进行权衡时仍感到困难。环境和任务创建经常受到我们称之为制件漂移的失败模式的影响:当指令、环境、信任源和验证器由松耦合的过程创建时,它们经常会对任务需求产生分歧,导致产生不可求解、可被奖励作弊或不一致的环境。我们引入锚定 (Anchor),一个任务生成管道,将业务工作流程的专业人员规范化为约束优化程序。从单个参数规范开始,管道联合生成自然语言指令、环境配置、求解器认证的真实解答和基于状态的验证器。通过锚定,更改参数可生成难度可控且已知最优解的新任务,产生无需适配器的环境,其奖励仅取决于最终业务正确性。我们将锚定应用于生成 ERP-Bench:一个包含 300 个长期范围任务的基准,涵盖采购和制造工作流程,这些工作流程在生产级 ERP 系统中运行。我们发现生成参数预测实现的难度,前沿模型在 26.1% 的试验中满足显式任务约束,但仅在 17.4% 的试验中达到完全最优解。总体而言,我们表明锚定和 ERP-Bench 为构建经济上有价值的智能体工作的可审计评估环境提供了具体的配方。我们在 erpbench.ai 上发布了任务生成器和 ERP-Bench 数据集

关键词

引用

@article{arxiv.2605.26321,
  title  = {Anchor: Mitigating Artifact Drift in Agent Benchmark Generation},
  author = {Maksim Ivanov and Abhijay Rana},
  journal= {arXiv preprint arXiv:2605.26321},
  year   = {2026}
}

备注

Accepted to RLEval '26 (Workshop at ACM Conference on AI and Agentic Systems 2026)