中文

当模拟说谎时:面向工具使用智能体的从仿真到现实的基准测试与域随机化强化学习方案

人工智能 2026-05-13 v1

摘要

工具使用语言智能体在假设输入干净、工具注册表明确且 API 可靠的基准上进行评估。真实部署违反了所有这些假设:用户拼写错误会传播到幻觉出的工具名称,配置错误的请求超时可能导致智能体无限期停滞,而跨服务器的重复工具名称可能冻结 SDK。我们将这些失败作为工具使用部分可观测马尔可夫决策过程(POMDP)中的从仿真到现实的差距来研究,其中部署噪声通过观测、动作空间、奖励相关元数据或转移动态进入。我们引入了 RobustBench-TC,一个包含 22 种扰动类型的基准,按这四个 POMDP 组件组织,每种扰动都基于一个已验证的 GitHub 问题或记录在案的工具调用失败。在从 1.5B 到 32B 参数的 21 个模型(包括闭源的 o4-mini)中,鲁棒性分布极不均衡:观测扰动将准确率降低了不到 5%,而奖励相关和转移动态扰动分别将准确率降低了约 40% 和 30%;仅靠规模无法缩小这些差距。然后,我们提出了 ToolRL-DR,一种领域随机化强化学习(RL)方案,它在涵盖三个可静态编码的 POMDP 组件的扰动增强轨迹上训练工具使用智能体。在 3B 骨干网络上,ToolRL-DR-Full 保留了大约四分之三的干净准确率,并达到了与开源 14B 函数调用基线相当的总扰动准确率,同时显著缩小了与 o4-mini 的差距。它缩小了大约 27% 的转移动态差距,尽管在训练中从未见过转移动态扰动,这表明在对抗性静态工具使用输入上进行强化学习可以诱导出更持久的重试策略,该策略可以迁移到未见过的运行时失败。数据集、代码和基准排行榜已公开可用。

关键词

引用

@article{arxiv.2605.11928,
  title  = {When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents},
  author = {Xiaolin Zhou and Aojie Yuan and Zheng Luo and Zipeng Ling and Xixiao Pan and Yicheng Gao and Haiyue Zhang and Jiate Li and Shuli Jiang and Prince Zizhuang Wang and Zixuan Zhu and Jinbo Liu and Ryan A. Rossi and Hua Wei and Xiyang Hu},
  journal= {arXiv preprint arXiv:2605.11928},
  year   = {2026}
}

备注

Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard