中文

理解顺序强化学习中的目标泛化

机器学习 2026-05-25 v1 人工智能

摘要

强化学习智能体常在训练分布之外表现出意外的目标导向行为,但目前缺乏一种原则性的方法来理解基于训练历史的智能体如何泛化到新环境。我们针对在一个或多个任务上顺序训练的智能体填补了这一空白。我们研究了超过100个顺序训练管道,评估其在250多个零样本分布环境中的行为。我们发现,显著特征驱动泛化,早期学习的目标可以持续并影响后续学习的目标。为解释这些现象,本文引入潜在策略梯度(latent policy gradients)方法,预测训练管道将如何在零样本分布行为中体现。该方法根据训练过程中低维潜在变量的演化来模拟,这些变量会根据训练目标实现高奖励,同时考虑潜在变量如何映射到行为的简单模型。它实现了强大的预测准确性,能泛化到未见的训练管道类型,并且具有可解释性。我们的发现表明,尽管零样本分布强化学习智能体行为取决于整个训练管道,但这种依赖性存在可捕捉的底层结构,为从发展视角理解目标泛化奠定了基础。

关键词

引用

@article{arxiv.2605.23565,
  title  = {Understanding Goal Generalisation in Sequential Reinforcement Learning},
  author = {Jason Ross Brown and Edward James Young},
  journal= {arXiv preprint arXiv:2605.23565},
  year   = {2026}
}