面向非平稳动态环境的基于上下文的软演员评论家方法
机器学习
2021-05-11 v2 人工智能
机器学习
摘要
深度强化学习方法在应用于具有非平稳动态的环境时性能易退化。本文利用近期元强化学习文献所启发的潜在上下文循环编码器,提出潜在上下文软演员评论家(LC-SAC)方法以解决上述问题。通过最小化对比预测损失函数,所学上下文变量捕获了环境动态与智能体近期行为的信息。随后结合软策略迭代范式,LC-SAC 方法在软策略评估与软策略改进之间交替,直至收敛至最优策略。实验结果表明,在动态于不同回合间剧烈变化的 MetaWorld ML1 任务上,LC-SAC 性能显著优于 SAC 算法;而在动态缓慢变化或不同回合间不变的连续控制基准任务 MuJoCo 上,其与 SAC 相当。此外,我们还进行了相关实验以确定不同超参数设置对 LC-SAC 算法性能的影响,并给出合理的超参数设置建议。
引用
@article{arxiv.2105.03310,
title = {Context-Based Soft Actor Critic for Environments with Non-stationary Dynamics},
author = {Yuan Pu and Shaochen Wang and Xin Yao and Bin Li},
journal= {arXiv preprint arXiv:2105.03310},
year = {2021}
}
备注
12 pages, 11 figures