中文

将规律性作为自由游戏的内在奖励

机器学习 2023-12-05 v1

摘要

我们提出将规律性作为内在动机强化学习的一种新颖奖励信号。受儿童发展的启发,我们假设对结构和秩序的追求有助于引导探索趋向于那些不被基于不确定性的朴素内在奖励所偏好的任务子空间。我们对规律性作为内在奖励的广义表述使我们能够在基于模型的强化学习中将其实用化。在合成环境中,我们展示了追求这一规律性目标所能涌现的大量结构化模式。我们还在多物体机器人操作环境中展示了该方法的有效性。我们将 RaIR 融入自由游戏,并将其作为内在奖励以补充模型的认知不确定性。在此过程中,我们观察到在自由游戏期间会自主构建塔及其他规律性结构,这促使装配任务的零样本下游任务性能获得大幅提升。

关键词

引用

@article{arxiv.2312.01473,
  title  = {Regularity as Intrinsic Reward for Free Play},
  author = {Cansu Sancaktar and Justus Piater and Georg Martius},
  journal= {arXiv preprint arXiv:2312.01473},
  year   = {2023}
}

备注

NeurIPS 2023 camera-ready version. Project webpage at http://sites.google.com/view/rair-project