基于内在动机学习目标条件策略的深度强化学习方法
机器学习
2021-12-14 v2 机器人学
摘要
对于智能体而言,学习一种广泛适用且通用的策略以达成包括图像与文本描述在内的多样化目标具有重要意义。考虑到此类感知特定的目标,深度强化学习研究的前沿在于无需手工设计奖励即可学习目标条件策略。为学习此类策略,近期工作通常将显式嵌入空间中到给定目标的非参数距离作为奖励。从另一视角出发,我们提出一种名为基于内在动机的目标条件策略(GPIM)的新型无监督学习方法,其联合学习抽象层策略与目标条件策略。抽象层策略以潜变量为条件来优化一个判别器,并发现多样化状态,这些状态被进一步渲染为供目标条件策略使用的感知特定目标。学习到的判别器充当目标条件策略的内在奖励函数,以模仿由抽象层策略诱导的轨迹。在多种机器人任务上的实验证明了我们所提 GPIM 方法的有效性与高效性,其大幅优于先前技术。
引用
@article{arxiv.2104.05043,
title = {Learn Goal-Conditioned Policy with Intrinsic Motivation for Deep Reinforcement Learning},
author = {Jinxin Liu and Donglin Wang and Qiangxing Tian and Zhengyu Chen},
journal= {arXiv preprint arXiv:2104.05043},
year = {2021}
}
备注
Accepted by AAAI-22