变分赋能作为基于目标强化学习的表征学习
机器学习
2021-06-04 v1 人工智能
摘要
通过互信息(MI)最大化来学习到达目标状态并学习多样化技能,已被提出作为自监督强化学习的原理性框架,使智能体能够以最小的奖励工程获取广泛适用的多任务策略。从一个简单观察出发,即标准目标条件强化学习(GCRL)被变分赋能的优化目标所囊括,我们讨论如何将GCRL和基于MI的RL推广为单一方法族,我们称之为变分GCRL(VGCRL),将变分MI最大化或变分赋能解释为获取用于目标到达的功能感知状态表征的表征学习方法。这一新颖视角使我们能够:(1)推导简单但未被探索的GCRL变体,以研究添加少量表征容量如何已经扩展其能力;(2)研究判别器函数容量与平滑度如何通过修改潜维度并应用谱归一化来决定所发现技能或潜目标的质量;(3)将诸如事后经验回放(HER)等技术从GCRL适配到基于MI的RL;以及最后,(4)提出一种名为潜目标到达(LGR)的新评估指标,用于比较具有不同潜维度与判别器参数化选择的赋能算法。通过原理性的数学推导与细致的实验研究,我们的工作为在基于目标的RL中评估、分析和开发表征学习技术奠定了新颖基础。
引用
@article{arxiv.2106.01404,
title = {Variational Empowerment as Representation Learning for Goal-Based Reinforcement Learning},
author = {Jongwook Choi and Archit Sharma and Honglak Lee and Sergey Levine and Shixiang Shane Gu},
journal= {arXiv preprint arXiv:2106.01404},
year = {2021}
}
备注
Accepted at International Conference on Machine Learning (ICML) 2021