使用近端策略优化结合课程学习与奖励工程解决现实世界优化问题
机器学习
2024-07-24 v2
摘要
我们提出一个通过课程学习(CL)原则和精细的奖励工程训练的近端策略优化(PPO)智能体,用于优化一个现实世界的高通量废物分拣设施。我们的工作解决了有效平衡操作安全、体积优化和最小化资源使用这些相互竞争目标的挑战。一个从头开始在这些多重标准上训练的普通智能体由于其固有的复杂性而无法解决问题。这个问题特别困难,因为环境具有极度延迟的奖励、长时间跨度以及类别(或动作)不平衡,在最优策略中重要动作不频繁。这迫使智能体预测长期动作后果并优先考虑罕见但有回报的行为,从而形成一个非平凡的强化学习任务。我们的五阶段课程学习方法通过逐步增加策略迁移过程中环境动态的复杂性,同时细化奖励机制,来应对这些挑战。这种迭代且自适应的过程使智能体能够学习到期望的最优策略。结果表明,我们的方法显著提高了推理时的安全性,实现了接近零的安全违规,同时提高了废物分拣厂的效率。
引用
@article{arxiv.2404.02577,
title = {Solving a Real-World Optimization Problem Using Proximal Policy Optimization with Curriculum Learning and Reward Engineering},
author = {Abhijeet Pendyala and Asma Atamna and Tobias Glasmachers},
journal= {arXiv preprint arXiv:2404.02577},
year = {2024}
}