中文

基于梯度的状态势策博弈学习方法用于自学习分布式生产系统

机器学习 2024-06-17 v1 人工智能 计算机科学与博弈论

摘要

本文介绍了用于自学习分布式生产系统中基于状态的势策博弈 (SbPG) 的新型梯度优化方法。SbPG因其在实现自优化分布式多主体系统方面的有效性而被认可,具有保证收敛性,能够促进各玩家协作努力以实现全局目标。在本研究中,我们致力于用当代梯度方法取代SbPG中常用的基于随机探索的学习方式,这些方法旨在实现更快的收敛速度和更平滑的探索动力学,从而缩短训练时间,同时保持SbPG的有效性。此外,我们提出了三种用于估计梯度学习目标函数的不同变体,每种方法都旨在适应所考虑系统的独特特征。为验证我们的方法,我们将其应用于实验室测试平台,即Bulk Good Laboratory Plant,这代表了一个智能且灵活的分布式多主体生产系统。SbPG集成梯度学习后,训练时间缩短,获得的策略也优于基线方法。

关键词

引用

@article{arxiv.2406.10015,
  title  = {Gradient-based Learning in State-based Potential Games for Self-Learning Production Systems},
  author = {Steve Yuwono and Marlon Löppenberg and Dorothea Schwung and Andreas Schwung},
  journal= {arXiv preprint arXiv:2406.10015},
  year   = {2024}
}