三种角色,一款模型:通过推理时间角色协调缩小小模型与大模型的性能差距
人工智能
2026-04-16 v2
摘要
大型语言模型(LLM)代理在真实可使用工具的任务上表现突出,但在有限硬件上部署高性能代理仍具有挑战性。我们研究是否仅通过推理时间脚手架(无需额外训练计算)即可提升小模型在复杂多步骤环境中的性能。在单块 24GB GPU 上,我们评估了 Qwen3-8B 在 AppWorld 基准上的表现,分别在全精度和 4-bit 量化配置下。毫无干预的情况下,原始模型仅实现 5.4%(FP16)和 3.0%(AWQ)的任务目标完成率。遵循系统性失败模式分析,我们引入三层推理脚手架管道,在三个不同角色中部署相同的冻结模型:(1)一个保存关键痕迹(token、凭证、API 响应)并压缩对话历史的摘要模型;(2)主要代理模型在压缩后的上下文上进行推理;(3)隔离的纠正模型在不访问对话历史的情况下审查和修订代理的 code 输出,打破重复失败循环。应用于相同的未修改模型,此脚手架实现了 8.9%(FP16)和 5.9%(AWQ)的任务目标完成率,在两种情况下均约为原性能的两倍,尤其在难度为 1 的任务上提升显著(15.8%→26.3% FP16;5.3%→14.0% AWQ)。在全精度推理下,我们的脚手架化 8B 模型超过了来自原始 AppWorld 评估的 DeepSeek-Coder 33B Instruct(7.1%),证明结构化推理时间干预可以让小模型与四倍大小的系统相竞争。我们将这种方法 formalized 为冻结基础模型上的脚手架化策略,三个相同权重的调用具有不同条件,援引了测试时间计算扩展和动作空间塑形在强化学习中的联系。
引用
@article{arxiv.2604.11465,
title = {Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents},
author = {S. Aaron McClendon and Jorge Gallego-Feliciano and Stavros Zervoudakis and Antonios Saravanos},
journal= {arXiv preprint arXiv:2604.11465},
year = {2026}
}