并行化反向课程生成
机器学习
2021-08-05 v1 机器人学
摘要
对于强化学习(RL),由于奖励稀疏,智能体难以掌握需要特定动作序列的任务。为解决此问题,反向课程生成(RCG)提供了一种反向扩展方法,自动为智能体生成课程以学习。更具体地,RCG随着训练进行,将初始状态分布从目标邻域自适应扩展到一定距离。然而,每次迭代生成的初始状态分布可能有偏,从而导致策略过拟合或降低反向扩展速率。当为基于actor-critic(AC)的RL算法训练RCG时,这种泛化差和收敛慢可能由AC对之间的紧耦合引起。因此,我们提出一种并行化方法,同时训练多个AC对并周期性交换它们的评论家。我们通过实验证明,该提出的方法能在性能和收敛性上改进RCG,并且也可应用于其他具有自适应初始状态分布的基于AC的RL算法。
关键词
引用
@article{arxiv.2108.02128,
title = {Parallelized Reverse Curriculum Generation},
author = {Zih-Yun Chiu and Yi-Lin Tuan and Hung-yi Lee and Li-Chen Fu},
journal= {arXiv preprint arXiv:2108.02128},
year = {2021}
}