中文

深度 Q 学习与近端策略优化:在物料分拣任务中的性能比较

人工智能 2023-06-05 v1 系统与控制 系统与控制

摘要

本文在模拟生产系统中比较了两种著名的深度强化学习(RL)算法:深度 Q 学习(DQN)与近端策略优化(PPO)。我们利用了相关工作中先前提出的基于 Petri 网(PN)的仿真环境。基于若干评估指标对两种算法的性能进行比较,包括正确装配与分拣产品的平均百分比、平均回合长度以及成功回合百分比。结果表明,在所有评估指标上 PPO 均优于 DQN。该研究突出了基于策略的算法在高维状态与动作空间问题中的优势。该研究通过提供不同算法有效性及其对各类任务适用性的见解,为生产系统背景下的深度 RL 领域作出贡献。

关键词

引用

@article{arxiv.2306.01451,
  title  = {Deep Q-Learning versus Proximal Policy Optimization: Performance Comparison in a Material Sorting Task},
  author = {Reuf Kozlica and Stefan Wegenkittl and Simon Hirländer},
  journal= {arXiv preprint arXiv:2306.01451},
  year   = {2023}
}

备注

Submitted and accepted version to the 32nd International Symposium on Industrial Electronics (ISIE), Helsinki, Finland