中文

Sensi:单次学习一个任务 —— 基于课程的 LLM 游戏智能体测试时学习

人工智能 2026-03-19 v1 机器学习

摘要

部署在未知环境中的大语言模型 (LLM) 智能体必须在测试时学习任务结构,但当前方法需要数千次交互才能形成有用的假设。我们提出了 Sensi,一种用于 ARC-AGI-3 游戏玩法挑战的 LLM 智能体架构,通过三种机制引入结构化测试时学习:(1) 分离感知与动作的双玩家架构;(2) 由外部状态机管理的课程学习系统;(3) 数据库作为控制平面,使智能体的上下文窗口可编程可驾驭。我们进一步引入了一个 LLM 作为评判官的组件,通过动态生成的评估准则来确定智能体是否已对一个主题学得足够,以便推进到下一个主题。我们报告了两个迭代的结果:Sensi v1 仅使用双玩家架构即可解决 2 个游戏关卡;而 Sensi v2 添加了课程学习,虽未解决任何关卡,但完成了整个学习课程,仅用约 32 次动作尝试,相较于需要 1600-3000 次尝试的类似系统实现了 50-94 倍的样本效率。我们精确诊断了失败模式为源自感知层的自洽幻觉级联,表明架构瓶颈已从学习效率转向感知 grounding —— 这是一个更可 tract 的问题。

关键词

引用

@article{arxiv.2603.17683,
  title  = {Sensi: Learn One Thing at a Time -- Curriculum-Based Test-Time Learning for LLM Game Agents},
  author = {Mohsen Arjmandi},
  journal= {arXiv preprint arXiv:2603.17683},
  year   = {2026}
}

备注

Preprint. 18 pages, 5 figures, 2 tables. Independent research. Code and Colab demo coming soon on GitHub