基于好奇心交叉熵方法与对比学习的样本高效实时规划
机器学习
2023-09-12 v2
摘要
基于模型的强化学习(MBRL)结合实时规划在运动控制和操作控制任务中展现出巨大潜力。然而,现有的规划方法,如交叉熵方法(CEM),在复杂高维环境中扩展性不佳。性能不佳的关键原因之一是缺乏探索,因为这些规划方法仅旨在最大化规划周期内的累积外在奖励。此外,在缺乏观测的紧凑隐空间内进行规划使得使用基于好奇心的内在激励具有挑战性。我们提出 Curiosity CEM (CCEM),一种改进版的 CEM 算法,通过好奇心鼓励探索。我们提出的方法在规划周期内最大化状态-动作 Q 值之和,其中这些 Q 值估计未来外在和内在奖励,从而鼓励到达新颖观测。此外,我们的模型使用对比表示学习高效学习隐表示。在 DeepMind Control 套件的基于图像的连续控制任务上的实验表明,CCEM 比先前的 MBRL 算法样本效率高出一个很大的幅度,并且优于最好的无模型 RL 方法。
引用
@article{arxiv.2303.03787,
title = {Sample-efficient Real-time Planning with Curiosity Cross-Entropy Method and Contrastive Learning},
author = {Mostafa Kotb and Cornelius Weber and Stefan Wermter},
journal= {arXiv preprint arXiv:2303.03787},
year = {2023}
}
备注
7 pages, 4 figures