DIVE:扩展代理任务综合中的多样性以实现通用工具使用
人工智能
2026-03-13 v1 软件工程
摘要
近期工作聚焦于为后训练类使用工具的大语言模型合成代理任务,但在任务和工具集变化下实现鲁棒的通用性仍是开放挑战。我们追溯到任务综合中的多样性不足。这一问题在训练中尤为突出,因为训练需要保持任务可执行和可验证,而通用性又要求覆盖多样的工具类型、工具集组合以及异构的工具使用模式。我们提出 DIVE,一种以证据为导向的配方,通过逆向合成顺序先执行多样化的真实工具,再严格推导由此产生的轨迹所必然包含的任务,从而通过构造本身提供 grounding。DIVE 在两个可控维度上扩展结构多样性:工具池覆盖率和每个任务的工具集多样性。进一步地,证据收集—任务推导循环诱导了跨 373 个工具、5 个领域的丰富多步骤工具使用模式。使用 DIVE 数据训练 Qwen3-8B(48k SFT + 3.2k RL),在 9 个 OOD 基准测试中平均提升 22 分,甚至以 +68 的优势超越最强的 8B 基线。值得注意的是,受控扩展分析揭示了,即使数据量为 4 倍,多样性扩展始终优于数量扩展在 OOD 通用性方面的表现。
引用
@article{arxiv.2603.11076,
title = {DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use},
author = {Aili Chen and Chi Zhang and Junteng Liu and Jiangjie Chen and Chengyu Du and Yunji Li and Ming Zhong and Qin Wang and Zhengmao Zhu and Jiayuan Song and Ke Ji and Junxian He and Pengyu Zhao and Yanghua Xiao},
journal= {arXiv preprint arXiv:2603.11076},
year = {2026}
}