ToolSample: 基于强化学习的工具学习中双动态采样方法与课程学习
机器学习
2025-09-19 v1 计算与语言
摘要
虽然强化学习(RL)越来越多地用于基于大语言模型的工具学习,但其效率常因简单样本的过度丰富而受到阻碍,这些样本随着训练的推进提供递减的学习价值。现有的动态采样技术不适于工具学习固有的多任务结构和细粒度奖励机制。本研究提出了动态采样与课程学习(DSCL)框架,专门针对工具学习的独特特征进行设计:其多个相互依赖的子任务和多值奖励函数。DSCL包含两个核心组件:基于奖励的动态采样,利用多维奖励统计量(均值和方差)来优先处理有价值的数据;以及基于任务的动态课程学习,自适应地聚焦于尚未熟练掌握的子任务。通过大量实验,我们证明DSCL显著提升了训练效率和模型性能,在BFCLv3基准上实现了3.29%的提升。我们的方法提供了一种定制化解决方案,有效利用工具学习中复杂的奖励信号和子任务动态以取得优异结果。
引用
@article{arxiv.2509.14718,
title = {ToolSample: Dual Dynamic Sampling Methods with Curriculum Learning for RL-based Tool Learning},
author = {Zihao Feng and Xiaoxue Wang and Bowen Wu and Hailong Cao and Tiejun Zhao and Qun Yu and Baoxun Wang},
journal= {arXiv preprint arXiv:2509.14718},
year = {2025}
}