利用不完美演示进行软 Q 学习预训练
机器学习
2019-05-10 v1 人工智能
机器学习
摘要
利用演示数据对强化学习方法进行预训练自大量计算资源被耗费于现有强化学习算法的在线仿真以来,一直是强化学习研究中的重要概念。预训练强化学习在利用专家演示的同时保持探索潜力方面仍是一项重大挑战,尤其对于基于值的方法。本文中,我们提出一种用于软 Q 学习的预训练方法。由于软 Q 学习是一种基于值的算法且等价于策略梯度,我们的工作受用于 actor-critic 算法的预训练方法启发。所提方法基于带熵正则化的 -折扣偏置策略评估,这也是软 Q 学习的更新目标。我们的方法在 Atari 2600 的多种任务上进行了评估。实验表明,我们的方法能从不完美演示中有效学习,并优于其他从专家演示中学习的最先进方法。
引用
@article{arxiv.1905.03501,
title = {Pretrain Soft Q-Learning with Imperfect Demonstrations},
author = {Xiaoqin Zhang and Yunfei Li and Huimin Ma and Xiong Luo},
journal= {arXiv preprint arXiv:1905.03501},
year = {2019}
}