基于先验知识规则的贝叶斯迁移强化学习
机器学习
2018-10-02 v1 机器学习
摘要
我们提出了一种概率框架,通过将行为策略定义为贝叶斯后验分布,将先验知识直接嵌入强化学习(RL)算法中。该后验结合了任务特定信息与前验知识,从而能够实现跨任务的迁移学习。所得方法灵活,可轻松集成到任何标准的离策略与在策略算法中,例如基于时序差分与策略梯度的算法。我们通过将先验知识表示为可在大量任务(如导航任务)中有用的通用确定性规则,开发了该贝叶斯迁移RL框架的一个具体实例。此外,我们通过对近期概率与熵正则化RL的深入阐述,开发了一种新颖的时序学习算法,并展示了如何将其与贝叶斯迁移RL结合。最后,我们演示了该方法在求解迷宫中的应用,并表明可获得显著的速度提升。
引用
@article{arxiv.1810.00468,
title = {Bayesian Transfer Reinforcement Learning with Prior Knowledge Rules},
author = {Michalis K. Titsias and Sotirios Nikoloutsopoulos},
journal= {arXiv preprint arXiv:1810.00468},
year = {2018}
}
备注
11 pages, 2 figures