协作深度强化学习
机器学习
2017-02-21 v1
摘要
除了独立学习,人类学习过程通过总结已学知识、与同伴交流并随后融合来自不同来源的知识以辅助当前学习目标而得到极大提升。这种协作学习过程确保知识被共享、持续精炼并从不同视角归纳,从而构建更深刻的理解。知识迁移的思想已推动机器学习和数据挖掘领域的诸多进展,但重大挑战依然存在,尤其在涉及强化学习、异构模型结构和不同学习任务时。受人类协作学习启发,本文提出一种协作深度强化学习(CDRL)框架,在异构学习智能体间执行自适应知识迁移。具体而言,所提CDRL采用一种新颖的深度知识蒸馏方法,通过深度对齐网络解决不同学习任务间的异质性。此外,我们提出一种高效的协作异步优势行动者-评论家(cA3C)算法,将深度知识蒸馏纳入智能体的在线训练,并利用OpenAI gym上的广泛实证评估证明了CDRL框架的有效性。
引用
@article{arxiv.1702.05796,
title = {Collaborative Deep Reinforcement Learning},
author = {Kaixiang Lin and Shu Wang and Jiayu Zhou},
journal= {arXiv preprint arXiv:1702.05796},
year = {2017}
}