中文

弱-for-强:训练弱型元智能体以驾驭强型执行者

人工智能 2025-04-08 v1

摘要

有效利用当代大型语言模型(LLM)的能力日益具有挑战性,尤其是当直接微调成本高昂且往往不切实际时。现有的无训练方法,如手动或自动设计的工作流程,通常需要大量人力或 yield 次优结果。本文提出一种“弱-for-强驾驭”(W4S)框架,定制小型、成本效益高的语言模型,以设计和优化驾驭强型模型的工作流程。W4S将工作流程设计形式化为多回合马尔可夫决策过程,引入强化学习智能体工作流程优化(RLAO)以训练弱型元智能体。通过与环境的迭代交互,元智能体学习设计越来越有效的工作流程,无需人工干预。实证结果表明,W4S的卓越性体现在:仅用一个GPU小时训练的7B元智能体,在十一个基准测试中超越最强 baselines,提升约2.9%~24.6%,成功提升了如GPT-3.5-Turbo和GPT-4o等最新模型的性能。值得注意的是,W4S在见到的和未见到的任务上都表现出强大的泛化能力,为直接微调强模型提供了一种高效、高性能的替代方案。

关键词

引用

@article{arxiv.2504.04785,
  title  = {Weak-for-Strong: Training Weak Meta-Agent to Harness Strong Executors},
  author = {Fan Nie and Lan Feng and Haotian Ye and Weixin Liang and Pan Lu and Huaxiu Yao and Alexandre Alahi and James Zou},
  journal= {arXiv preprint arXiv:2504.04785},
  year   = {2025}
}