让离线强化学习流动起来:在归一化流潜空间中训练保守智能体
机器学习
2023-01-31 v2 人工智能
神经与进化计算
摘要
离线强化学习旨在基于预先记录且固定的数据集训练策略,而无需任何额外的环境交互。该设定下存在两大挑战:(1) 由近似训练数据未充分覆盖的状态-动作对价值所引起的外推误差;(2) 行为策略与推理策略之间的分布偏移。解决这些问题的一种方法是引入保守性——即让学到的策略更贴近行为策略。为此,我们基于近期在潜动作空间中学习策略的工作,使用一种特殊形式的归一化流(Normalizing Flows)构建生成模型,并将其用作保守动作编码器。该归一化流动作编码器先在离线数据集上以监督方式预训练,随后通过强化学习训练一个额外的策略模型——潜空间中的控制器。该方法避免查询训练数据集之外的动作,因此无需针对数据集外动作进行额外正则化。我们在多种运动与导航任务上评估了我们的方法,结果表明在大部分数据集上,我们的方法优于近期提出的带有生成式动作模型的算法。
引用
@article{arxiv.2211.11096,
title = {Let Offline RL Flow: Training Conservative Agents in the Latent Space of Normalizing Flows},
author = {Dmitriy Akimov and Vladislav Kurenkov and Alexander Nikulin and Denis Tarasov and Sergey Kolesnikov},
journal= {arXiv preprint arXiv:2211.11096},
year = {2023}
}
备注
Accepted at 3rd Offline Reinforcement Learning Workshop at Neural Information Processing Systems, 2022. Source code: https://github.com/tinkoff-ai/cnf