中文

基于强化学习策略梯度算法的机器硬件容错性提升

机器学习 2024-07-23 v1 人工智能 机器人学

摘要

产业正快速向完全自主和互联的系统迈进,这些系统能够检测并适应变化的条件,包括机器硬件故障。传统方法通过冗余组件和算法性地在故障发生时重新配置机器的进程来实现硬件容错。然而,日益增长的强化学习基于机器人控制方法为实现硬件容错提供了新的视角。然而,针对机器硬件容错的这些方法的潜力尚未得到广泛探索。本文研究了两种最先进的强化学习算法——近端策略优化(PPO)和软演员-评论家(SAC),如何提高机器的硬件容错性。我们在两个 OpenAI Gym 模拟环境中评估了这些算法的性能:Ant-v2 和 FetchReach-v1。在这些环境中,机器人模型被施加六种模拟硬件故障。此外,我们进行了消融研究,以确定将代理在正常(故障前)环境中所学知识传输到(故障后)环境中的最佳方法。我们的结果表明,基于强化学习的方法能够提高模拟机器的硬件容错性,适应过程仅需数分钟。具体而言,PPO 在保留模型中知识时表现最快,而 SAC 在丢弃所有已学知识时表现最佳。总体而言,本研究凸显了如 PPO 和 SAC 等基于强化学习的方法对于机器硬件容错具有潜力。这些发现为开发能够在真实场景中有效运行的鲁棒且自适应的机器提供了道路。

关键词

引用

@article{arxiv.2407.15283,
  title  = {Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms},
  author = {Sheila Schoepp and Mehran Taghian and Shotaro Miwa and Yoshihiro Mitsuka and Shadan Golestan and Osmar Zaïane},
  journal= {arXiv preprint arXiv:2407.15283},
  year   = {2024}
}