ToolOmni: 通过具备主动检索与扎实执行的智能体学习实现开放世界工具使用
计算与语言
2026-04-16 v1
摘要
大语言模型 (LLMs) 通过利用外部工具来提高问题解决能力。然而,在工具库庞大且不断演化的开放世界场景中,现有方法依赖静态嵌入检索或参数记忆工具,难以将用户意图与工具语义对齐,或难以泛化到未出现的工具,从而导致开放世界工具检索和执行准确性不佳。为此,我们提出 ToolOmni,一个统一的智能体框架,通过具备主动检索与扎实执行于推理循环中,使 LLMs 能够进行开放世界工具使用。首先,我们构建一个冷启动多轮交互数据集,通过监督式微调 (SFT) 来培养基础智能体能力。随后,我们引入基于解耦多目标 GRPO 算法的开放世界工具学习,该算法同时优化 LLMs 在在线环境中的工具检索准确性和执行效果。大量实验表明,ToolOmni 在检索和执行方面均实现了状态最佳性能,相较于强基准以显著超过 +10.8% 的端到端执行成功率,同时展现出卓越的鲁棒性和泛化能力。
引用
@article{arxiv.2604.13787,
title = {ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution},
author = {Shouzheng Huang and Meishan Zhang and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2604.13787},
year = {2026}
}
备注
19 pages, 9 figures, 9 tables, accepted to ACL 2026