中文

马尔可夫决策过程设计对 Sim-to-Real 强化学习的影响

机器学习 2026-03-13 v2

摘要

强化学习(RL)在工业过程控制中展现出巨大的潜力,但在物理硬件上部署时,模拟训练的策略常常存在显著的 sim-to-real 差距。本工作系统性地分析了核心马尔可夫决策过程(MDP)设计选择——状态组成、目标包含、奖励函数、终止准则以及环境动态模型——如何影响这一转移。我们采用颜色混合任务,对不同 MDP 配置和混合动力学在模拟和真实世界实验中的表现进行评估。在物理硬件上验证我们的发现,表明在严格的精度约束下,基于物理的动态模型可实现最高达 50% 的真实世界成功率,而简化模型则完全失败。我们的结果为在工业过程控制中部署 RL 提供了实用的 MDP 设计指南。

关键词

引用

@article{arxiv.2603.09427,
  title  = {Impact of Markov Decision Process Design on Sim-to-Real Reinforcement Learning},
  author = {Tatjana Krau and Jorge Mandlmaier and Tobias Damm and Frieder Heieck},
  journal= {arXiv preprint arXiv:2603.09427},
  year   = {2026}
}

备注

This work has been submitted to the IEEE for possible publication