中文

深度强化与 InfoMax 学习

机器学习 2020-11-17 v3 机器学习

摘要

我们从一个假设出发:一个无模型智能体,若其表征能预测未来状态的属性(超出期望奖励之外),将更善于解决并适应新的 RL 问题。为验证该假设,我们引入了一种基于 Deep InfoMax (DIM) 的目标,该目标通过最大化其连续时间步内部表征之间的互信息来训练智能体预测未来。我们在若干合成环境中测试了我们的方法,它成功学习了可预测未来的表征。最后,我们用时间 DIM 目标增强了强大的 RL 基线 C51,并展示了在持续学习任务与最近提出的 Procgen 环境上性能的改善。

关键词

引用

@article{arxiv.2006.07217,
  title  = {Deep Reinforcement and InfoMax Learning},
  author = {Bogdan Mazoure and Remi Tachet des Combes and Thang Doan and Philip Bachman and R Devon Hjelm},
  journal= {arXiv preprint arXiv:2006.07217},
  year   = {2020}
}

备注

NeurIPS 2020