中文

MAGELLAN:学习进度的元认知预测引导大目标空间中的自寻目标 LLM 智能体

人工智能 2026-04-28 v3

摘要

开放式学习智能体必须在广阔的可能性空间中高效地确定目标优先级,专注于那些能最大化学习进度(LP)的目标。当这种自寻目标的探索由在高维且不断演化的目标空间中通过在线 RL 训练的 LLM 智能体实现时,LP 预测面临的一个关键挑战是对自身能力进行建模,这是一种元认知监控。传统方法要么需要大量采样,要么依赖于脆弱的专家定义目标分组。我们引入了 MAGELLAN,这是一个让 LLM 智能体在线学习预测自身能力与 LP 的元认知框架。通过捕捉目标之间的语义关系,MAGELLAN 能够实现样本高效的 LP 估计,并通过泛化动态适应不断演化的目标空间。在交互式学习环境中,我们展示了 MAGELLAN 提高了 LP 预测效率与目标优先级排序,是唯一能让智能体完全掌握大型且不断演化的目标空间的方法。这些结果表明,用 LP 预测的元认知能力增强 LLM 智能体,可以有效地将课程学习扩展至开放式目标空间。

关键词

引用

@article{arxiv.2502.07709,
  title  = {MAGELLAN: Metacognitive predictions of learning progress guide autotelic LLM agents in large goal spaces},
  author = {Loris Gaven and Thomas Carta and Clément Romac and Cédric Colas and Sylvain Lamprier and Olivier Sigaud and Pierre-Yves Oudeyer},
  journal= {arXiv preprint arXiv:2502.07709},
  year   = {2026}
}