ToolRLA:面向工具集成智能体的乘法奖励分解
人工智能
2026-03-12 v4
摘要
虽然能够在推理与 API 调用之间交织的工具集成智能体在复杂任务中表现前景光明,但在高风险、领域特定的部署场景中仍面临对齐难题:现有强化学习方法依赖粗糙的二元奖励,无法区分工具选择错误与参数格式错误。我们提出 ToolRLA,一个用于领域特定工具智能体的三阶段后训练管线(SFT -> GRPO -> DPO)。核心贡献是一种细粒度奖励函数,通过乘法正确性分解在四个维度上实现奖励分解——格式有效性、工具选择、参数准确性和合规性——该函数将领域优先级排序编码为奖励景观中的归纳偏置。部署在金融顾问助理系统(80 名顾问,1200+ 条每日查询)后,ToolRLA 在三个月内实现了:任务完成率提升 47%(62%→91%),工具调用错误减少 63%(38%→14%),合规违规减少 93%(12%→0.8%),且延迟在亚 2 秒内。消融实验表明,乘法奖励设计相较于加法方案提升了 7 个百分点。进一步在 ToolBench 和 API-Bank 上验证了其泛化能力。
引用
@article{arxiv.2603.01620,
title = {ToolRLA: Multiplicative Reward Decomposition for Tool-Integrated Agents},
author = {Pengbo Liu},
journal= {arXiv preprint arXiv:2603.01620},
year = {2026}
}