通过自监督简化深度强化学习
机器学习
2021-06-11 v1
摘要
对有示范数据进行有监督回归已被证明是训练深度策略网络的一种稳定方法。我们致力于研究如何充分利用有监督损失函数稳定地训练深度强化学习智能体。这是一项具有挑战性的任务,因为尚不清楚如何收集训练数据以实现策略改进。在这项工作中,我们提出了自监督强化学习(SSRL),一种仅使用有监督损失优化策略的简单算法。我们证明,无需策略梯度或价值估计,迭代执行“标注”数据与有监督回归的过程就足以驱动稳定的策略改进。通过选择并模仿具有高回合奖励的轨迹,SSRL出人意料地比当代算法更具竞争力,且具有更稳定的性能和更短的运行时间,展示了用监督学习技术解决强化学习的潜力。代码可在 https://github.com/daochenzha/SSRL 获取。
引用
@article{arxiv.2106.05526,
title = {Simplifying Deep Reinforcement Learning via Self-Supervision},
author = {Daochen Zha and Kwei-Herng Lai and Kaixiong Zhou and Xia Hu},
journal= {arXiv preprint arXiv:2106.05526},
year = {2021}
}