中文

将多种策略迁移至热启动强化学习以求解空气压缩机管理问题

人工智能 2023-01-31 v1

摘要

许多相似或几乎相同的工业机器或工具常被一次性或紧接部署。例如,某一特定型号的空气压缩机可能安装于数百个客户处。由于这些工具执行不同但高度相似的任务,能够针对已为机器 1..N 生成的控制器,快速为机器 N+1 产出高质量控制器是很有意义的。当控制器通过强化学习训练得到时这一点更为重要,因为训练耗费时间、能源及其他资源。本文中,我们应用策略交集(一种策略塑造方法),通过从若干先前习得的控制器迁移知识,帮助强化学习智能体更快地学会求解压缩机控制问题的一个新变体。我们展示了我们的方法优于直接加载旧控制器,并在长期中显著提升了性能。

关键词

引用

@article{arxiv.2301.12820,
  title  = {Transferring Multiple Policies to Hotstart Reinforcement Learning in an Air Compressor Management Problem},
  author = {Hélène Plisnier and Denis Steckelmacher and Jeroen Willems and Bruno Depraetere and Ann Nowé},
  journal= {arXiv preprint arXiv:2301.12820},
  year   = {2023}
}

备注

Preliminary version, experimental details still to be made more precise