基于在线滤波的安全强化学习:用于生产中疲劳预测的人机任务规划与分配
人工智能
2026-04-17 v2
摘要
人机协作制造是产业5.0的核心方面,强调人体工学以提升工人的福祉。本文解决动态人机任务规划与分配(HRTPA)问题,即确定何时执行任务以及由谁执行,以最大化效率同时确保工人身体疲劳保持在安全范围内。疲劳约束的加入以及生产动态的存在显著增加了HRTPA问题的复杂度。传统HRTPA中的疲劳恢复模型常依赖静态、预定义的超参数。然而实际情况中,人类疲劳敏感性因如工作条件变化和睡眠不足等因素而日间变化。为更好地捕捉这种不确定性,我们将疲劳相关参数视为不准确的,并基于生产期间观察到的疲劳进程在线估计这些参数。为此,我们提出了PF-CD3Q方法,一种将粒子滤波与受约束的对抗双深度Q学习集成用于实时疲劳预测HRTPA的安全强化学习方法。具体而言,我们首先开发了基于PF的估计算子,用于跟踪人类疲劳并实时更新疲劳模型参数。随后,这些估计算子被集成到CD3Q中,通过在决策过程中进行任务级疲劳预测并排除超过疲劳限制的任务,从而约束动作空间,将问题形式化为受约束马尔可夫决策过程(CMDP)。
引用
@article{arxiv.2604.12667,
title = {Safe reinforcement learning with online filtering for fatigue-predictive human-robot task planning and allocation in production},
author = {Jintao Xue and Xiao Li and Nianmin Zhang},
journal= {arXiv preprint arXiv:2604.12667},
year = {2026}
}
备注
This is the accepted manuscript of an article accepted for publication in \textit{Journal of Manufacturing Systems (Elsevier)