对比价值学习:用于简单离线 RL 的隐式模型
机器学习
2022-11-07 v1 人工智能
摘要
基于模型的强化学习(RL)方法在离线设定中具有吸引力,因为它们允许智能体推理动作的后果而无需与环境交互。先前的方法学习 1 步动力学模型,该模型在给定当前状态与动作时预测下一状态。这些模型并不能立即告诉智能体应采取哪些动作,而必须被整合进更大的 RL 框架中。我们能否以不同方式对环境动力学建模,使得所学模型直接指示每个动作的价值?在本文中,我们提出对比价值学习(CVL),它学习一种隐式的、多步的环境动力学模型。该模型无需奖励函数即可学习,但尽管如此仍可用于直接估计每个动作的价值,而不需要任何 TD 学习。由于该模型隐式地表示多步转移,它避免了预测高维观测,从而可扩展到高维任务。我们的实验表明,CVL 在复杂连续控制基准上优于先前的离线 RL 方法。
引用
@article{arxiv.2211.02100,
title = {Contrastive Value Learning: Implicit Models for Simple Offline RL},
author = {Bogdan Mazoure and Benjamin Eysenbach and Ofir Nachum and Jonathan Tompson},
journal= {arXiv preprint arXiv:2211.02100},
year = {2022}
}
备注
Deep Reinforcement Learning Workshop, NeurIPS 2022