中文

Multi-Mission Tool Bench:通过关联与动态任务评估基于 LLM 的智能体的鲁棒性

人工智能 2025-04-17 v3

摘要

大语言模型(LLMs)凭借其先进的理解与规划能力,在作为工具调用的智能体方面展现出强大的潜力。用户越来越依赖基于 LLM 的智能体通过迭代交互来解决复杂任务。然而,现有基准主要在单任务场景下评估智能体,未能捕捉真实世界的复杂性。为弥补这一差距,我们提出了 Multi-Mission Tool Bench。在该基准中,每个测试用例由多个相互关联的任务组成。这种设计要求智能体动态适应不断变化的需求。此外,所提出的基准在固定任务数量下探索了所有可能的任务切换模式。具体而言,我们提出了一种多智能体数据生成框架来构建该基准。我们还提出了一种利用动态决策树评估智能体决策准确性与效率的新方法。在多种开源与闭源 LLM 上的实验揭示了影响智能体鲁棒性的关键因素,并为工具调用领域提供了可操作的洞见。

关键词

引用

@article{arxiv.2504.02623,
  title  = {Multi-Mission Tool Bench: Assessing the Robustness of LLM based Agents through Related and Dynamic Missions},
  author = {Peijie Yu and Yifan Yang and Jinjian Li and Zelong Zhang and Haorui Wang and Xiao Feng and Feng Zhang},
  journal= {arXiv preprint arXiv:2504.02623},
  year   = {2025}
}