从模型扩展到系统扩展:代理人AI中的Harness扩展
人工智能
2026-05-26 v1 机器学习
摘要
本文研究代理人AI中的下一个主要瓶颈,即系统扩展,而不仅仅是模型扩展:围绕基础模型设计可审计、持久、模块化且可验证的架构。我们将这一转变称为扩展Harness:将围绕基础模型的结构化执行层作为设计、评估和优化的一级对象来对待。虽然最近的大型语言模型使代理能够使用工具、检索信息、保持记忆并执行长期工作流程,但评估仍主要是以模型为中心,往往将代理简化为最终任务成功,而将记忆、检索、工具使用、编排、验证和治理视为次要的实现细节。这种框架日益不足,因为代理性能源于基础模型、记忆基座、上下文构造器、技能路由层、编排循环和验证与治理层之间的相互作用。这些组件共同构成了代理Harness,将模型能力转化为长期代理行为。我们通过三大核心瓶颈来研究扩展Harness:上下文治理、可信记忆和动态技能路由,以及协调和约束这些组件的编排与治理机制。我们进一步概述了一项研究议程,旨在开发Harness级别的基准测试,超越一次性任务成功,衡量轨迹质量、记忆卫生、上下文效率、通信忠诚度、验证成本以及随时间安全演化。为使讨论具体化,我们开发了CheetahClaws: https://github.com/SafeRL-Lab/cheetahclaws,一个基于Python的参考Harness,并与Claude Code和OpenClaw进行比较。我们的主要论点是,代理人AI的未来进展将在系统设计方面发挥重要作用,同样依赖于更强大的基础模型。
引用
@article{arxiv.2605.26112,
title = {From Model Scaling to System Scaling: Scaling the Harness in Agentic AI},
author = {Shangding Gu},
journal= {arXiv preprint arXiv:2605.26112},
year = {2026}
}