中文

面向非平稳动态环境的基于上下文的软演员评论家方法

机器学习 2021-05-11 v2 人工智能 机器学习

摘要

深度强化学习方法在应用于具有非平稳动态的环境时性能易退化。本文利用近期元强化学习文献所启发的潜在上下文循环编码器,提出潜在上下文软演员评论家(LC-SAC)方法以解决上述问题。通过最小化对比预测损失函数,所学上下文变量捕获了环境动态与智能体近期行为的信息。随后结合软策略迭代范式,LC-SAC 方法在软策略评估与软策略改进之间交替,直至收敛至最优策略。实验结果表明,在动态于不同回合间剧烈变化的 MetaWorld ML1 任务上,LC-SAC 性能显著优于 SAC 算法;而在动态缓慢变化或不同回合间不变的连续控制基准任务 MuJoCo 上,其与 SAC 相当。此外,我们还进行了相关实验以确定不同超参数设置对 LC-SAC 算法性能的影响,并给出合理的超参数设置建议。

关键词

引用

@article{arxiv.2105.03310,
  title  = {Context-Based Soft Actor Critic for Environments with Non-stationary Dynamics},
  author = {Yuan Pu and Shaochen Wang and Xin Yao and Bin Li},
  journal= {arXiv preprint arXiv:2105.03310},
  year   = {2021}
}

备注

12 pages, 11 figures