中文

让离线强化学习流动起来:在归一化流潜空间中训练保守智能体

机器学习 2023-01-31 v2 人工智能 神经与进化计算

摘要

离线强化学习旨在基于预先记录且固定的数据集训练策略,而无需任何额外的环境交互。该设定下存在两大挑战:(1) 由近似训练数据未充分覆盖的状态-动作对价值所引起的外推误差;(2) 行为策略与推理策略之间的分布偏移。解决这些问题的一种方法是引入保守性——即让学到的策略更贴近行为策略。为此,我们基于近期在潜动作空间中学习策略的工作,使用一种特殊形式的归一化流(Normalizing Flows)构建生成模型,并将其用作保守动作编码器。该归一化流动作编码器先在离线数据集上以监督方式预训练,随后通过强化学习训练一个额外的策略模型——潜空间中的控制器。该方法避免查询训练数据集之外的动作,因此无需针对数据集外动作进行额外正则化。我们在多种运动与导航任务上评估了我们的方法,结果表明在大部分数据集上,我们的方法优于近期提出的带有生成式动作模型的算法。

关键词

引用

@article{arxiv.2211.11096,
  title  = {Let Offline RL Flow: Training Conservative Agents in the Latent Space of Normalizing Flows},
  author = {Dmitriy Akimov and Vladislav Kurenkov and Alexander Nikulin and Denis Tarasov and Sergey Kolesnikov},
  journal= {arXiv preprint arXiv:2211.11096},
  year   = {2023}
}

备注

Accepted at 3rd Offline Reinforcement Learning Workshop at Neural Information Processing Systems, 2022. Source code: https://github.com/tinkoff-ai/cnf