中文

Continual Harness: 面向自我改进基础智能体的在线自适应

机器学习 2026-05-12 v1 人工智能

摘要

诸如 Claude Code 和 OpenHands 等编程框架用工具、记忆和规划封装基础模型,但在具身智能体的长时程部分可观测决策方面尚无等价物。我们首先报告 Gemini Plays Pokemon (GPP) 实验。通过迭代式人机协同框架改进,GPP 成为首个在困难模式下完成 Pokemon Blue、Yellow Legacy 以及 Crystal 且未输掉任何一场战斗的 AI 系统。在最困难的阶段,智能体本身开始通过长上下文记忆迭代其策略,在人机协同改进之外涌现出自发自我改进信号。Continual Harness 将人类完全从该循环中移除:这是一个面向具身智能体的无重置自我改进框架,将我们所观察到的现象形式化并自动化。仅从最小环境接口开始,智能体在行动与改进自身提示、子智能体、技能和记忆之间交替进行,并利用任何过往轨迹数据。提示优化方法需要回合重置;Continual Harness 则在单次运行内进行在线自适应。在 Pokemon Red 和 Emerald 上,跨前沿模型测试表明,从零开始的 Continual Harness 相对于极简基线大幅降低了按键成本,并恢复了与手工设计的专家框架之间的大部分差距,取得了依赖于能力的增益,尽管其起点是相同的原始接口,没有精选知识、手工工具和领域脚手架。随后我们用模型本身闭环:一个在线过程奖励协同学习循环,其中开源智能体通过改进框架的 rollout 被前沿教师模型重新标记并用于更新模型,在 Pokemon Red 上推动了持续的游戏内里程碑进展,且在训练迭代间无需重置环境。

关键词

引用

@article{arxiv.2605.09998,
  title  = {Continual Harness: Online Adaptation for Self-Improving Foundation Agents},
  author = {Seth Karten and Joel Zhang and Tersoo Upaa and Ruirong Feng and Wenzhe Li and Chengshuai Shi and Chi Jin and Kiran Vodrahalli},
  journal= {arXiv preprint arXiv:2605.09998},
  year   = {2026}
}

备注

28 pages, 19 figures, 5 tables