中文

自回归模型中的涌现时序抽象驱动层次化强化学习

机器学习 2025-12-25 v2 人工智能

摘要

大规模自回归模型在进行下一令牌预测的预训练任务后,通过强化学习(RL)进行微调,已在诸多问题领域实现空前成功。在 RL 过程中,这些模型通过逐个生成新输出来进行探索。然而,逐令牌采样动作会导致学习效率极低,尤其在奖励稀疏时更为明显。我们发现,通过在自回归模型的内部表示中进行作用与探索,可克服这一问题。具体而言,为发现时序抽象动作,我们引入一种更高阶、非因果序列模型,其输出控制基本自回归模型的残差流激活。我们在网格世界和基于 MuJoCo 的具有层次结构的任务上实验,发现更高阶模型学习将长时序激活序列块压缩至内部控制器上。每个控制器执行一系列在长时间尺度上展开的行为有意义动作,并伴随学习到的终止条件,从而通过时间组合多个控制器可实现对新任务的高效探索。我们表明,直接的内部控制器强化学习(我们称为“内部 RL”)可在标准 RL 微调失败的情形下实现稀疏奖励学习。我们的结果表明,潜在动作生成与强化学习在自回归模型中的优势,表明内部 RL 作为实现自回归模型中层次化 RL 的前景途径。

关键词

引用

@article{arxiv.2512.20605,
  title  = {Emergent temporal abstractions in autoregressive models enable hierarchical reinforcement learning},
  author = {Seijin Kobayashi and Yanick Schimpf and Maximilian Schlegel and Angelika Steger and Maciej Wolczyk and Johannes von Oswald and Nino Scherrer and Kaitlin Maile and Guillaume Lajoie and Blake A. Richards and Rif A. Saurous and James Manyika and Blaise Agüera y Arcas and Alexander Meulemans and João Sacramento},
  journal= {arXiv preprint arXiv:2512.20605},
  year   = {2025}
}