中文

SPIKE:面向成本高效的长期博弈智能体的自适应双控制器框架

计算机视觉与模式识别 2026-05-19 v1

摘要

开放世界游戏中的长期多模态智能体必须在严格的 token 和延迟预算下,在许多低层交互中保持目标导向。现有方法通常在昂贵的逐步推理与容易漂移、重复失败且恢复不佳的反应式执行之间进行权衡。我们的核心思想是在局部稳定片段中重用战略推理,并在事件边界处重新调用它。我们提出了 SPIKE,一个面向成本高效的长期游戏控制的自适应双控制器框架。其战略控制器执行低频全局规划、故障分析和恢复,而其反应控制器在严格的 token 预算下处理快速的局部执行。事件触发器监控视觉变化、任务进度、重复动作和失败信号,以决定控制应保持反应式还是升级为战略推理。分层记忆将状态-动作记忆库 (State-Action Memory Bank, SA-MB) 中的短期经验重用与状态-动作知识图谱 (State Action Knowledge Graph, SA-KG) 中的结构化证据分离开来,允许每个控制器检索其所需的上下文。这种设计在多个反应步骤中重用战略提案,在计划过时支持局部覆盖,并将昂贵的推理保留用于额外深思有益的时刻。在 StarDojo 的 Lite-100 划分上,SPIKE 比最强的 Lite-100 基线将 Lite-100 成功率 (SR) 提高了 5.0 个百分点(相对 38.5%),比最强的预算基线将预算成功率 (Budgeted SR) 提高了 9.3 个百分点(相对 75.6%)。它还将 token 消耗减少了 54.9%,延迟减少了 40.8%。消融实验表明,事件触发、反应式覆盖和异构记忆各自对成功和恢复有贡献,支持选择性推理而非每一步都进行推理。

关键词

引用

@article{arxiv.2605.18636,
  title  = {SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents},
  author = {Wencan Jiang and Jiangning Zhang and Jianbiao Mei and Jinzhuo Liu and Yu Yang and Xiaobin Hu and Zhucun Xue and Yong Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2605.18636},
  year   = {2026}
}

备注

https://wencanjiang.github.io/projects/SPIKE/