中文

工业基准上的批量强化学习:初步经验

机器学习 2018-01-26 v2 人工智能 神经与进化计算 系统与控制

摘要

粒子群优化策略(PSO-P)近期被提出,并已证明在离线、批量设置下与学术强化学习基准交互时能产生显著结果。为进一步探究其在实际应用中的性质与可行性,本文在所谓的工业基准(IB)上研究PSO-P。IB是一种新型强化学习(RL)基准,旨在通过包含工业应用中的多种方面(如连续状态与动作空间、高维部分可观测状态空间、延迟效应以及复杂随机性)来贴近现实。将PSO-P在IB上的实验结果与基于模型的循环控制神经网络(RCNN)和无模型的神经拟合Q迭代(NFQ)导出的闭式控制策略的结果进行比较。实验表明,PSO-P不仅对学术基准有意义,而且对现实工业应用也有价值,因为它在我们的IB设置中也产生了性能最佳的策略。与其他成熟的RL技术相比,PSO-P在性能和鲁棒性方面均取得了突出结果,且只需相对较少的工作量来寻找合适参数或做出复杂的设计决策。

关键词

引用

@article{arxiv.1705.07262,
  title  = {Batch Reinforcement Learning on the Industrial Benchmark: First Experiences},
  author = {Daniel Hein and Steffen Udluft and Michel Tokic and Alexander Hentschel and Thomas A. Runkler and Volkmar Sterzing},
  journal= {arXiv preprint arXiv:1705.07262},
  year   = {2018}
}