中文

大语言模型中的未奖励探索揭示了来自心理学的潜在学习

机器学习 2026-02-02 v1

摘要

潜在学习在托尔曼的理论中被提出,显示生物智能体(如大鼠)可以在奖励外获取环境的内部表征,从而在奖励引入后实现快速适应。相比之下,从认知科学角度看,奖励学习仍过度依赖外部反馈,限制了灵活性和泛化能力。尽管近期大型语言模型(LLM)如 OpenAI-o1 和 DeepSeek-R1 在推理能力上的突破表明显进展,但这些模型仍主要依赖基于奖励的强化学习范式。LLM 中是否存在及如何体现经典心理学中的潜在学习现象尚未得到充分探索。本文我们 presenting 的实验发现,LLM 也表现出潜在学习动力学。在初始的未奖励探索阶段,LLM 显示出 modest 的性能提升,因为该阶段允许 LLM 在不受奖励驱动偏差约束的情况下组织任务相关知识,随后在引入奖励后性能进一步提升。在两阶段探索训练后,LLM 最终实现的性能优于持续基于奖励的强化学习训练的 LLM。除了这些经验观察外,我们还提供了对实验的理论分析,解释为何未奖励的探索产生性能提升,提供了这些动力学的机制性解释。具体地,我们在多个模型家族和多样任务域上进行了广泛实验,以确立 LLM 中潜在学习动力学的存在。

关键词

引用

@article{arxiv.2601.22474,
  title  = {Unrewarded Exploration in Large Language Models Reveals Latent Learning from Psychology},
  author = {Jian Xiong and Jingbo Zhou and Zihan Zhou and Yixiong Xiao and Le Zhang and Jingyong Ye and Rui Qian and Yang Zhou and Dejing Dou},
  journal= {arXiv preprint arXiv:2601.22474},
  year   = {2026}
}

备注

17pages, 1 figure