中文

一种通过人类辅助遥操作实现实时自我改进的强化学习数字孪生框架

系统与控制 2024-06-04 v1 系统与控制

摘要

强化学习或深度强化学习是在环境模型先验未知时求解马尔可夫决策过程的强大方法。然而,强化学习模型仍面临协变量偏移和人类演示质量保证等挑战。为了解决这些挑战并进一步推进深度强化学习模型,我们的工作通过数字孪生开发了一个人在环深度强化学习框架,该框架在部署后利用人类智能实时重新训练深度强化学习模型。首先,我们开发了一个完全基于在模拟环境中通过试错学习的预训练模型,从而实现了可扩展性和自动化,同时消除了可能来自主观人类指导的变异性和偏差。其次,我们不是将训练好的模型直接部署在无人地面车辆上,而是创建了一个数字孪生,从虚拟环境控制物理无人地面车辆。第三,为了允许持续学习而不发生灾难性遗忘,我们引入了模型在重新训练开始时借助少量人类指导进行自我改进的能力。我们在模拟和真实环境中测试了所提模型的性能,包括静态和动态障碍物。结果表明,我们提出的方法不仅在奖励累积方面优于基线模型,而且表现出更优的训练效率。

关键词

引用

@article{arxiv.2406.00732,
  title  = {A Digital Twin Framework for Reinforcement Learning with Real-Time Self-Improvement via Human Assistive Teleoperation},
  author = {Kabirat Olayemi and Mien Van and Luke Maguire and Sean McLoone},
  journal= {arXiv preprint arXiv:2406.00732},
  year   = {2024}
}