中文

面向通用工业装配线平衡问题的新型多智能体动作掩码深度强化学习

人工智能 2025-07-23 v1

摘要

高效的活动规划是现代工业装配线维持制造标准、防止项目约束违规以及实现成本效益运营的关键。虽然可以通过整数规划 (IP) 获取此类挑战的精确解,但输入参数导致的搜索空间常常使 IP 在大规模场景下难以计算。启发式方法如遗传算法也可应用,但经常在大规模情况下产生次优解。本文引入了一种通用的工业装配线的数学模型,构建为马尔可夫决策过程 (MDP),且不对装配线类型作出假设——这与大多数现有模型有显著区别。所提出的模型用于创建用于训练深度强化学习 (DRL) 智能体的虚拟环境,以优化任务和资源调度。为提高智能体训练效率,本文提出了两种创新工具。第一是一种动作掩码技术,确保智能体仅选择可行动作,从而缩短训练时间。第二是一种多智能体方法,即每个工作站由单个智能体管理,结果缩小了状态和动作空间。采用中心化训练、去中心化执行的框架,为优化工业装配线提供了可扩展的学习架构。该框架允许智能体离线学习,随后在操作期间通过将当前工厂状态映射到最优动作的神经网络,提供即时解决方案。通过数值仿真验证了所提出方案的有效性,结果表明其相对于类似基于模型的方法具有显著更快的收敛速度。

关键词

引用

@article{arxiv.2507.16635,
  title  = {Novel Multi-Agent Action Masked Deep Reinforcement Learning for General Industrial Assembly Lines Balancing Problems},
  author = {Ali Mohamed Ali and Luca Tirel and Hashim A. Hashim},
  journal= {arXiv preprint arXiv:2507.16635},
  year   = {2025}
}