MUA-RL:面向智能体工具使用的多轮用户交互式智能体强化学习
人工智能
2025-08-27 v1
摘要
随着近期智能体智能的快速发展,LLM 中的智能体工具使用变得越来越重要。在智能体与用户的多轮交互过程中,用户需求的动态、不确定和随机性质对智能体的工具调用能力提出了重大挑战。智能体不再被期望仅仅调用工具来交付结果;相反,它们必须通过交流迭代地细化对用户需求的理解,同时调用工具来解决用户的查询。现有的用于工具使用的强化学习(RL)方法缺乏在 RL 训练过程中集成真正动态的用户。为了弥合这一差距,我们引入了 MUA-RL(面向智能体工具使用的多轮用户交互式智能体强化学习),这是一个新颖的强化学习框架,首次在智能体工具使用领域将 LLM 模拟的用户集成到强化学习循环中。MUA-RL 旨在使模型能够自主学习与用户高效交流,并在动态多轮交互中使用各种工具来解决实际问题。评估在几个多轮工具使用基准上进行(见图 1)。具体而言,MUA-RL-32B 在 TAU2 Retail 上达到 67.3,在 TAU2 Airline 上达到 45.4,在 TAU2 Telecom 上达到 28.3,在 BFCL-V3 Multi Turn 上达到 28.4,在 ACEBench Agent 上达到 82.5——在非思考设置下优于或匹配了诸如 DeepSeek-V3-0324 和 Qwen3-235B-A22B 等更大规模开源模型的性能。
引用
@article{arxiv.2508.18669,
title = {MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use},
author = {Weikang Zhao and Xili Wang and Chengdi Ma and Lingbin Kong and Zhaohua Yang and Mingxiang Tuo and Xiaowei Shi and Yitao Zhai and Xunliang Cai},
journal= {arXiv preprint arXiv:2508.18669},
year = {2025}
}