Skew-Fit:面向状态覆盖的自监督强化学习
机器学习
2020-08-05 v4 人工智能
机器人学
机器学习
摘要
必须具备灵活且广泛能力的自主智能体需要配备大量的技能库。以人工设计的奖励函数定义每个技能会限制该技能库并带来人工工程负担。设定自身目标的自监督智能体可自动化此过程,但设计恰当的目标设定目标可能困难,且常涉及启发式设计决策。本文中,我们提出一个形式化的目标到达策略探索目标,用于最大化状态覆盖。我们证明该目标等价于最大化目标到达性能与目标分布的熵之和,其中目标对应于完整的状态观测。为实例化该原理,我们提出一种称为 Skew-Fit 的算法,用于学习最大熵目标分布。我们证明,在正则条件下,即便事先不知有效状态集合,Skew-Fit 也收敛于该集合上的均匀分布。我们的实验表明,将 Skew-Fit 用于学习目标分布并与现有目标到达方法结合,在开源视觉目标到达任务上优于多种已有方法。此外,我们展示 Skew-Fit 使真实世界机器人能从零开始、仅从像素、且无任何人工设计奖励函数地学会开门。
引用
@article{arxiv.1903.03698,
title = {Skew-Fit: State-Covering Self-Supervised Reinforcement Learning},
author = {Vitchyr H. Pong and Murtaza Dalal and Steven Lin and Ashvin Nair and Shikhar Bahl and Sergey Levine},
journal= {arXiv preprint arXiv:1903.03698},
year = {2020}
}
备注
ICML 2020. 8 pages, 8 figures; 9 pages appendix (6 additional figures)