中文

基于检查列表奖励的强化学习:面向多轮多步骤智能体工具使用的 CM2 框架

人工智能 2026-02-24 v2

摘要

AI 智能体日益增多地用于通过推理多轮用户交互并调用外部工具来解决实际任务。然而,将强化学习应用于此类设置仍然困难:现实目标往往缺乏可验证的奖励,强调开放性行为;此外,针对多轮、多步骤的智能体工具使用,强化学习仍鲜有探索;并且构建和维护可执行工具环境成本高昂,限制了规模和覆盖范围。我们提出 CM2 框架,用检查列表奖励取代可验证的结果奖励。CM2 将每个回合的预期行为分解为细粒度的二元准则,具备显式证据依据和结构化元数据,将开放式判断转化为更稳定的分类式决策。为平衡稳定性和信息性,我们的方法采用稀疏奖励分配但稠密评估准则的策略。在可扩展的 LLM 模拟工具环境中进行训练,规避了大型工具集的繁重工程。实验表明,CM2 在监督微调上 consistently 获得提升。从 8B 基础模型开始,在 8k 示例的 RL 数据集上训练,CM2 在 tau^-Bench 上超过 SFT counterpart 提升 8 分,在 BFCL-V4 上提升 10 分,在 ToolSandbox 上提升 12 分。结果不仅匹配甚至超越了 similarly 规模的开源基准,包括评判模型。CM2 提供了一种 scalable 的配方,用于在不依赖可验证奖励的情况下优化多轮、多步骤工具使用智能体。代码由开源社区提供:https://github.com/namezhenzhang/CM2-RLCR-Tool-Agent

关键词

引用

@article{arxiv.2602.12268,
  title  = {CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use},
  author = {Zhen Zhang and Kaiqiang Song and Xun Wang and Yebowen Hu and Weixiang Yan and Chenyang Zhao and Henry Peng Zou and Haoyun Deng and Sathish Reddy Indurthi and Shujian Liu and Simin Ma and Xiaoyang Wang and Xin Eric Wang and Song Wang},
  journal= {arXiv preprint arXiv:2602.12268},
  year   = {2026}
}