基于多元奖励表示与知识蒸馏的分布式软演员-评论家方法
人工智能
2020-04-13 v2 机器学习
摘要
在本文中,我们描述了 NeurIPS 2019 Learning to Move - Walk Around 挑战赛的基于物理的环境,并呈现了我们针对该竞赛的解决方案,其取得了 1303.727 平均奖励分数并获得第 3 名。我们的方法结合了连续与离散动作空间强化学习的最新进展,例如软演员-评论家(Soft Actor-Critic)与分布式强化学习中的循环经验回放(Recurrent Experience Replay)。我们分两个阶段训练智能体:第一阶段移动到某处,第二阶段跟随目标速度场。我们还引入了新颖的 Q 函数拆分技术,我们相信其有助于智能体训练任务,允许评论家预训练并将其复用于求解更困难的问题,并减轻奖励塑形设计负担。
引用
@article{arxiv.1911.13056,
title = {Distributed Soft Actor-Critic with Multivariate Reward Representation and Knowledge Distillation},
author = {Dmitry Akimov},
journal= {arXiv preprint arXiv:1911.13056},
year = {2020}
}
备注
9 pages, 5 figures