中文

基于神经奖励函数的开放式强化学习

机器学习 2022-10-13 v2 人工智能 机器人学

摘要

受无监督学习在计算机视觉与自然语言处理领域巨大成功的启发,强化学习社区近来开始更多地关注技能的无监督发现。当前大多数方法,如 DIAYN 或 DADS,优化某种形式的互信息目标。我们提出了一种不同的方法,使用由神经网络编码的奖励函数。这些网络被迭代训练以奖励更复杂的行为。在高维机器人环境中,我们的方法学到了多种有趣技能,包括 Half-Cheetah 的前空翻和 Humanoid 的单腿奔跑。在基于像素的 Montezuma's Revenge 环境中,我们的方法仅需极小改动即可工作,并学到了涉及与物品交互和访问多样位置的复杂技能。我们方法的实现可在此链接找到:https://github.com/amujika/Open-Ended-Reinforcement-Learning-with-Neural-Reward-Functions。

关键词

引用

@article{arxiv.2202.08266,
  title  = {Open-Ended Reinforcement Learning with Neural Reward Functions},
  author = {Robert Meier and Asier Mujika},
  journal= {arXiv preprint arXiv:2202.08266},
  year   = {2022}
}