深度强化学习在带用户偏好的装配序列规划问题中的应用
机器学习
2023-04-14 v1
摘要
深度强化学习(DRL)已展现出其在解决复杂制造决策问题中的潜力,特别是在系统于无训练数据情况下通过实际运行随时间学习的场景中。此类方法一个有趣且具有挑战性的应用是装配序列规划(ASP)问题。在本文中,我们提出了一种在 ASP 中实施 DRL 方法的途径。所提方法在 RL 环境中引入参数化动作以改善训练时间与样本效率,并使用两种不同的奖励信号:(1)用户偏好与(2)总装配时长。用户偏好信号解决人类所面临的装配困难与非工效学特性,总装配时长信号则强制优化装配。研究了三种最强大的深度 RL 方法:优势 actor-critic(A2C)、深度 Q 学习(DQN)和 Rainbow,在随机与确定性两种不同场景中。最后,将 DRL 算法的性能与表格 Q 学习的性能进行比较。经过 10,000 个回合后,表格 Q 学习、A2C 和 Rainbow 算法均实现了近最优行为。不过,对于更复杂的场景,预期表格 Q 学习算法相对于另外两种算法表现不佳。结果支持了深度强化学习在带人机交互的装配序列规划问题中应用的潜力。
引用
@article{arxiv.2304.06567,
title = {Deep reinforcement learning applied to an assembly sequence planning problem with user preferences},
author = {Miguel Neves and Pedro Neto},
journal= {arXiv preprint arXiv:2304.06567},
year = {2023}
}