深度 Q 学习与近端策略优化:在物料分拣任务中的性能比较
人工智能
2023-06-05 v1 系统与控制
系统与控制
摘要
本文在模拟生产系统中比较了两种著名的深度强化学习(RL)算法:深度 Q 学习(DQN)与近端策略优化(PPO)。我们利用了相关工作中先前提出的基于 Petri 网(PN)的仿真环境。基于若干评估指标对两种算法的性能进行比较,包括正确装配与分拣产品的平均百分比、平均回合长度以及成功回合百分比。结果表明,在所有评估指标上 PPO 均优于 DQN。该研究突出了基于策略的算法在高维状态与动作空间问题中的优势。该研究通过提供不同算法有效性及其对各类任务适用性的见解,为生产系统背景下的深度 RL 领域作出贡献。
引用
@article{arxiv.2306.01451,
title = {Deep Q-Learning versus Proximal Policy Optimization: Performance Comparison in a Material Sorting Task},
author = {Reuf Kozlica and Stefan Wegenkittl and Simon Hirländer},
journal= {arXiv preprint arXiv:2306.01451},
year = {2023}
}
备注
Submitted and accepted version to the 32nd International Symposium on Industrial Electronics (ISIE), Helsinki, Finland