基于好奇心对比前向动力学模型的样本高效强化学习表征学习
机器学习
2023-01-13 v2 人工智能
机器人学
摘要
在强化学习(RL)中开发能够直接从原始像素等高维观测执行复杂控制任务的智能体仍具挑战,人们致力于提升样本效率与泛化能力。本文考虑一种好奇心对比前向动力学模型(CCFDM)的学习框架,以基于原始像素实现更具样本效率的 RL。CCFDM 结合前向动力学模型(FDM)并执行对比学习,训练其基于深度卷积神经网络的图像编码器(IE)以提取有助于提升 RL 样本效率的时空信息。此外,训练期间 CCFDM 提供基于 FDM 预测误差生成的内在奖励,激发 RL 智能体的好奇心以改善探索。由我们的探索策略与对比学习中可用的数据增强所提供的发散且少重复观测,不仅提升了样本效率,也改善了泛化能力。构建于 CCFDM 之上的现有无模型 RL 方法(如 Soft Actor-Critic)在 DeepMind Control Suite 基准上优于先前最先进的基于像素的 RL 方法。
引用
@article{arxiv.2103.08255,
title = {Sample-efficient Reinforcement Learning Representation Learning with Curiosity Contrastive Forward Dynamics Model},
author = {Thanh Nguyen and Tung M. Luu and Thang Vu and Chang D. Yoo},
journal= {arXiv preprint arXiv:2103.08255},
year = {2023}
}