AI模型能否互相指导?组织结构作为训练局限性的探针
软件工程
2026-03-30 v1 人工智能
摘要
一个昂贵的AI模型能否有效地指导一个廉价的模型来解决软件工程任务?我们通过引入ManagerWorker来研究这个问题,这是一个双智能体流水线,其中昂贵的"管理者"模型(仅文本,无代码执行)分析问题、调度探索任务并审查实现,而廉价的"工作者"模型(拥有完整的代码库访问权限)执行代码更改。我们在SWE-bench Lite的200个实例上进行了评估,涵盖五种配置,这些配置在管理者-工作者关系、流水线复杂度和模型配对方面各不相同。我们的发现揭示了多智能体指导的前景与局限:(1)强管理者指导弱工作者(62%)以强单智能体(60%)的一小部分token使用量匹配了强单智能体(60%),表明昂贵的推理可以替代昂贵的执行;(2)弱管理者指导弱工作者(42%)的表现不如弱智能体单独(44%),表明指导关系需要真正的能力差距——没有实质的结构只是纯粹的额外开销;(3)管理者的价值在于指导,而不仅仅是审查——一个最小的仅审查循环仅比基线增加2个百分点,而结构化的探索和规划增加了11个百分点,表明主动指导是使能力差距产生生产力的关键;(4)这些行为追溯到一个单一的根本原因:当前模型被训练为单智能体,将它们拆分为管理者和工作者角色与它们的训练分布相冲突。该流水线的成功在于围绕这种不匹配进行设计——使每个模型接近其训练模式(管理者进行文本生成,工作者进行工具使用),并将组织结构外部化到代码中。这一诊断指出了具体的训练差距:委派、作用域执行和模式切换是当前训练数据中缺失的技能。
引用
@article{arxiv.2603.26458,
title = {Can AI Models Direct Each Other? Organizational Structure as a Probe into Training Limitations},
author = {Rui Liu},
journal= {arXiv preprint arXiv:2603.26458},
year = {2026}
}