基于规划准度量的多任务强化学习方法
机器学习
2020-12-08 v3 机器学习
摘要
我们引入了一种新的强化学习方法,将规划准度量(PQM)——其估计从任意状态到另一状态所需步数——与任务特定的“瞄准器”相结合,后者计算达到给定目标所需到达的目标状态。这种分解允许跨任务共享对环境的动态进行建模且与任务无关的准度量模型,并且该模型可以以稠密且无监督的方式学习。与近期发表的方法在标准的比特翻转问题和MuJoCo机械臂模拟器上相比,我们实现了多倍的训练加速。
引用
@article{arxiv.2002.03240,
title = {Multi-task Reinforcement Learning with a Planning Quasi-Metric},
author = {Vincent Micheli and Karthigan Sinnathamby and François Fleuret},
journal= {arXiv preprint arXiv:2002.03240},
year = {2020}
}
备注
Deep RL Workshop, NeurIPS 2020