基于强化学习掌握人机协作装配中的工序序列
机器人学
2020-07-09 v1 系统与控制
系统与控制
摘要
制造系统中人机协作(HRC)的一个长期目标是提高协同工作效率。顺应工业 4.0 构建智能制造系统的趋势,HRC 系统中的协作机器人值得更好地设计,以更具自组织性,并通过自学习达到超越人类的熟练度。受 Google Deep Mind 开发的 AlphaGo Zero 等令人印象深刻的机器学习算法启发,本文将人机协作装配工作过程构建为棋盘,并以棋盘中的走子选择类比 HRC 装配工作过程中人与机器人的决策。为获得使工作效率最大化的工序最优策略,机器人采用基于强化学习的自对弈算法进行训练,除游戏规则外无需任何指导或领域知识。同时训练了一个神经网络,用于预测走子选择优先级分布以及某一工序序列是否带来 HRC 效率最大值。以可调书桌装配演示了所提出的 HRC 装配算法及其效率。
引用
@article{arxiv.2007.04140,
title = {Mastering the working sequence in human-robot collaborative assembly based on reinforcement learning},
author = {Tian Yu and Jing Huang and Qing Chang},
journal= {arXiv preprint arXiv:2007.04140},
year = {2020}
}
备注
11 pages, 6 figures