中文

通过自监督利用内部状态表示改进基于模型的强化学习

机器学习 2022-01-19 v1 人工智能

摘要

利用环境模型,强化学习智能体可以规划其未来行动,并在国际象棋、将棋和围棋等棋盘游戏中取得超越人类的性能,同时保持相对较高的样本效率。正如 MuZero 算法所展示的,环境模型甚至可以动态学习,将智能体推广到更多任务,同时达到最先进的性能。值得注意的是,MuZero 使用从真实环境状态导出的内部状态表示进行预测。在本文中,我们通过两个附加项将模型预测的内部状态表示与环境状态绑定:一个重构模型损失和一个更简单的一致性损失,二者均独立且无监督地工作,作为约束来稳定学习过程。我们的实验表明,这种重构模型损失与更简单一致性损失的新整合在 OpenAI Gym 环境中提供了显著的性能提升。我们的修改还实现了 MuZero 的自监督预训练,因此该算法可以在目标可用之前了解环境动态。

关键词

引用

@article{arxiv.2102.05599,
  title  = {Improving Model-Based Reinforcement Learning with Internal State Representations through Self-Supervision},
  author = {Julien Scholz and Cornelius Weber and Muhammad Burhan Hafez and Stefan Wermter},
  journal= {arXiv preprint arXiv:2102.05599},
  year   = {2022}
}