中文

基于强化学习的控制器从模型在环到硬件在环的迁移

机器学习 2025-03-06 v1 人工智能

摘要

为嵌入式系统开发控制功能是一个消耗资源、时间和数据的过程,常导致次优的成本和解决方案方法。强化学习(RL)在自主训练智能体以最少人工干预执行复杂控制任务方面具有巨大潜力。然而,由于数据生成成本高和安全约束,其应用大多局限于纯仿真领域。为了在嵌入式系统功能开发中有效使用RL,生成的智能体必须能够处理现实世界应用。在此背景下,本工作聚焦于通过结合迁移学习(TL)和X-in-the-Loop(XiL)仿真来加速RL智能体的训练过程。针对内燃机瞬态废气再循环控制的用例,利用计算廉价的模型在环(MiL)仿真来选择合适算法、微调超参数,并最终训练用于迁移的候选智能体。这些预训练的RL智能体随后通过TL在硬件在环(HiL)系统中进行微调。迁移揭示了在过渡到真实硬件时需要调整奖励参数。此外,纯HiL训练智能体与迁移智能体之间的比较显示训练时间减少了5.9倍。结果强调了使用真实硬件训练RL智能体的必要性,并表明迁移策略的成熟度影响训练时间和性能,凸显了TL与XiL仿真之间的强协同效应。

关键词

引用

@article{arxiv.2310.17671,
  title  = {Transfer of Reinforcement Learning-Based Controllers from Model- to Hardware-in-the-Loop},
  author = {Mario Picerno and Lucas Koch and Kevin Badalian and Marius Wegener and Joschka Schaub and Charles Robert Koch and Jakob Andert},
  journal= {arXiv preprint arXiv:2310.17671},
  year   = {2025}
}