连续控制多任务深度强化学习中的知识迁移
机器学习
2020-10-19 v2 人工智能
摘要
尽管深度强化学习(DRL)已成为许多复杂任务的一种有前景的方法,但训练一个能够执行多种不同连续控制任务的单一 DRL 智能体仍然具有挑战性。本文提出一种用于连续控制的知识迁移多任务深度强化学习框架(KTM-DRL),其通过从特定任务教师学习,使单一 DRL 智能体在多个不同任务中达到专家级性能。在 KTM-DRL 中,多任务智能体首先利用专为 actor-critic 架构设计的离线知识迁移算法,从特定任务教师的经验中快速学习控制策略,然后采用在线学习算法,在那些教师的指导下从新的在线转移样本中学习以进一步提升自身。我们在 MuJoCo 连续控制任务套件中两个常用基准上进行了全面的实证研究。实验结果充分证明了 KTM-DRL 及其知识迁移与在线学习算法的有效性,以及其大幅优于 SOTA 的优势。
引用
@article{arxiv.2010.07494,
title = {Knowledge Transfer in Multi-Task Deep Reinforcement Learning for Continuous Control},
author = {Zhiyuan Xu and Kun Wu and Zhengping Che and Jian Tang and Jieping Ye},
journal= {arXiv preprint arXiv:2010.07494},
year = {2020}
}