多样性即所需:无奖励函数下的技能学习
人工智能
2018-10-11 v6 机器人学
摘要
智能生物能够探索环境并在无监督下学习有用技能。本文中,我们提出 DIAYN('Diversity is All You Need'),一种无需奖励函数即可学习有用技能的方法。我们提出的方法通过使用最大熵策略最大化信息论目标来学习技能。在多种模拟机器人任务上,我们表明这一简单目标导致了行走和跳跃等多样技能的无监督涌现。在若干强化学习基准环境中,尽管从未接收到真实任务奖励,我们的方法仍能学习到解决基准任务的技能。我们展示了预训练技能如何为下游任务提供良好的参数初始化,并可被分层组合以解决复杂、稀疏奖励任务。我们的结果表明,技能的无监督发现可作为克服强化学习中探索与数据效率挑战的有效预训练机制。
引用
@article{arxiv.1802.06070,
title = {Diversity is All You Need: Learning Skills without a Reward Function},
author = {Benjamin Eysenbach and Abhishek Gupta and Julian Ibarz and Sergey Levine},
journal= {arXiv preprint arXiv:1802.06070},
year = {2018}
}
备注
Videos and code for our experiments are available at: https://sites.google.com/view/diayn