基于优化训练数据集的最优演员-评论家策略
机器学习
2021-12-02 v2 系统与控制
系统与控制
摘要
演员-评论家(AC)算法以其在解决强化学习问题中的有效性和高性能而著称,但它们也存在采样效率低下的问题。基于 AC 的策略优化过程是迭代的,需要频繁访问智能体-环境系统,通过滚动策略、收集奖励和状态(即样本)并从中学习来评估和更新策略。最终需要大量样本来学习最优策略。为提高采样效率,我们提出了一种优化训练数据集的策略,该数据集包含从 AC 过程中收集的显著更少的样本。数据集优化由仅最佳回合操作、策略参数-适应度模型以及遗传算法模块组成。由优化训练数据集训练出的最优策略网络在控制自主动力系统方面表现出优于许多当代 AC 算法的性能。在标准基准上的评估表明,该方法提高了采样效率,确保更快收敛到最优值,并且比同类方法更具数据效率。
引用
@article{arxiv.2108.06911,
title = {Optimal Actor-Critic Policy with Optimized Training Datasets},
author = {Chayan Banerjee and Zhiyong Chen and Nasimul Noman and Mohsen Zamani},
journal= {arXiv preprint arXiv:2108.06911},
year = {2021}
}