AgenticQwen:基于双数据飞轮训练小型代理语言模型以实现工业级工具使用
计算与语言
2026-04-24 v1
摘要
现代工业应用日益需要能够在实际场景中进行多步推理和工具使用的语言模型。这些任务通常在严格的成本和延迟约束下进行,使得小型代理模型备受青睐。本文介绍了 AgenticQwen 模型家族,通过多轮强化学习 (RL) 在合成数据和有限 amount 的开源数据上进行训练。我们的训练框架结合了推理 RL 和代理 RL,采用双数据飞轮自动生成越来越具挑战性的任务。推理飞轮通过学习错误信息来增加任务难度,而代理飞轮将线性工作流程扩展为多分支行为树,更好地反映了真实应用场景的决策复杂度。我们在公共基准测试和工业代理系统中验证了 AgenticQwen。该模型在多个代理基准测试中取得优异成绩,在我们的工业代理系统中,缩小了与大型模型在搜索和数据分析任务中的差距。模型检查点和部分合成数据:https://huggingface.co/collections/alibaba-pai/agenticqwen。数据合成和 RL 训练代码:https://github.com/haruhi-sudo/data_synth_and_rl。数据合成管道也集成到 EasyDistill:https://github.com/modelscope/easydistill。
引用
@article{arxiv.2604.21590,
title = {AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use},
author = {Yuanjie Lyu and Chengyu Wang and Haonan Zheng and Yuanhao Yue and Junbing Yan and Ming Wang and Jun Huang},
journal= {arXiv preprint arXiv:2604.21590},
year = {2026}
}