Floyd-Warshall 强化学习:从过往经验中学习以达成新目标
机器学习
2019-01-08 v4 机器学习
摘要
考虑涉及静态环境与动态目标的多元目标任务。此类任务的例子比比皆是,例如机器人中的目标导向导航与拾放操作。用于此类任务的强化学习(RL)算法有两类:无模型或基于模型。这些方法各有局限。无模型 RL 在目标位置变化时难以迁移已学信息,但在单目标任务中能达到高渐近精度。基于模型 RL 可通过保留显式学习的状态动力学将已学信息迁移至新目标位置,但受限于如下事实:对这些动力学的建模误差会在长期规划中累积。在本工作中,我们改进了无模型 RL 在多目标域中的局限性。我们通过将 Floyd-Warshall 算法适配于 RL 来实现这一点,并称该适配为 Floyd-Warshall RL(FWRL)。所提算法通过约束任意两状态间最优路径的值不小于经由中间状态的路径的值,来学习目标条件动作值函数。在实验上,我们表明在表格域中,与 Q-learning、基于模型的 RL 及其他相关基线相比,FWRL 更具采样效率,并在多目标任务中学习到更高回报的策略。
引用
@article{arxiv.1809.09318,
title = {Floyd-Warshall Reinforcement Learning: Learning from Past Experiences to Reach New Goals},
author = {Vikas Dhiman and Shurjo Banerjee and Jeffrey M. Siskind and Jason J. Corso},
journal= {arXiv preprint arXiv:1809.09318},
year = {2019}
}