通过梯度匹配集成领域知识以实现样本高效强化学习
机器学习
2020-05-29 v1 人工智能
机器学习
摘要
无模型深度强化学习(RL)智能体可直接从与黑盒环境的重复交互中学习有效策略。然而在实践中,算法常需大量训练经验才能良好学习与泛化。此外,经典无模型学习忽略了状态转移元组中包含的域信息。另一方面,基于模型的 RL 试图从经验中学习环境模型,其样本效率显著更高,但因不完美的动力学模型而遭受明显较大的渐近偏差。本文中,我们提出一种梯度匹配算法,利用来自动力学预测器的目标斜率信息辅助无模型学习器,从而提高样本效率。我们通过在抽象低维空间中匹配基于模型学习器的梯度信息与无模型组件的技术来展示这一点,并通过实验结果验证所提技术,证明了该方法的有效性。
引用
@article{arxiv.2005.13778,
title = {Domain Knowledge Integration By Gradient Matching For Sample-Efficient Reinforcement Learning},
author = {Parth Chadha},
journal= {arXiv preprint arXiv:2005.13778},
year = {2020}
}