中文

从记忆到地图:变压器中基于奖励学习的内在机制

人工智能 2025-12-03 v3

摘要

人类和动物表现出卓越的数据学习效率,能够仅凭有限的经验适应新环境。这种能力并未被标准强化学习算法所捕捉,这些算法依赖于增量价值更新。快速适应可能取决于记忆——即检索特定过去经验以指导在新情境中的决策的能力。变压器是一个研究这些问题的有用环境,因为它们能够在内在环境中快速学习,并且其关键-值体系结构类似于大脑中的记忆系统。我们训练一个变压器在受 rodent 行为启发的规划任务分布中进行内在强化学习,然后描述模型中所涌现的学习算法。我们首先发现,记忆通过内在结构学习和跨情境对齐来支持表示学习,其中表示在不同感官刺激的环境中被对齐。我们随后演示,模型所发展出的强化学习策略不可解释为标准的无模型或基于模型的规划。相反,我们表明,内在强化学习通过缓存模型记忆标记中的中间计算来实现,这些计算随后在决策时被访问。总体而言,我们发现记忆可能作为一种计算资源,存储原始经验和已缓存的计算,以支持灵活的行为。此外,模型中 developing 的表示类似于与大脑中海马-嗅入系统相关的计算,表明我们的发现可能与自然认知相关。综上所述,我们的工作为人工和自然环境中内在学习所基于的快速适应提供了一种机制学说。

关键词

引用

@article{arxiv.2506.19686,
  title  = {From Memories to Maps: Mechanisms of In-Context Reinforcement Learning in Transformers},
  author = {Ching Fang and Kanaka Rajan},
  journal= {arXiv preprint arXiv:2506.19686},
  year   = {2025}
}

备注

Revised to around 9 pages