Adaptive Multi-Agent Reasoning via Automated Workflow Generation
人工智能
2025-07-22 v1
摘要
大型推理模型(LRM)的崛起为语言模型能力的显著跃迁提供了前景,旨在以前所未有的效率和准确性解决日益复杂的任务。然而,尽管这些模型表现突出,近期研究仍指出当前推理模型经常无法对新颖、未见的问题进行泛化,常常依赖记忆中的解决方案而非真正的推理。这种行为凸显了现代 LRM 的一个关键局限性,即它们倾向于过拟合,进而导致问题解决能力差。本文引入了 Nexus Architect,即我们多智能体系统框架 Nexus 的一个增强版本,配备了 novel 自动化工作流程合成机制。给定用户的提示和一小组代表性示例,Architect 自动生成针对特定问题类的定制推理工作流程,通过选择合适的策略、工具集成和对抗技术来实现。此外,Architect 包括一种迭代提示细化机制,通过微调智能体的系统提示来最大化性能并提高系统的泛化能力。我们通过在自定义的具有挑战性逻辑问题数据集上使用即插即用的非推理模型来实证评估 Nexus Architect,并将其性能与最先进的 LRMs 进行比较。结果表明,Nexus Architect 持续地超过现有解决方案,在 Gemini 2.5 Flash Preview 上的通过率提高了最高可达 66%,相较于 Claude Sonnet 4 和 DeepSeek-R1 近 2.5 倍,相对于 Llama 4 Scout 超过 3 倍。
引用
@article{arxiv.2507.14393,
title = {Adaptive Multi-Agent Reasoning via Automated Workflow Generation},
author = {Humza Sami and Mubashir ul Islam and Pierre-Emmanuel Gaillardon and Valerio Tenace},
journal= {arXiv preprint arXiv:2507.14393},
year = {2025}
}