中文

通过无量纲化马尔可夫决策过程提高控制器的泛化能力

机器学习 2025-04-15 v1

摘要

基于强化学习训练的控制器倾向于高度专业化,因而在测试环境与训练环境不同时泛化能力差。我们提出一种基于模型的方法,通过无量纲化状态-动作空间训练世界模型和策略,来提高泛化能力。为此,我们引入了无量纲化马尔可夫决策过程(Π\Pi-MDP):即在上下文型马尔可夫决策过程中,对状态和动作空间应用布拉金-Π\Pi 定理进行无量纲化。此程序诱导出随底层动态上下文变化而等价的策略。我们提供了该方法的通用框架,并应用于基于高斯过程模型的模型基策略搜索算法。我们在仿真的作动摆锤和小车摆姿系统上演示了该方法的可行性,其中在单一环境上训练的策略对上下文分布的偏移具有鲁棒性。

关键词

引用

@article{arxiv.2504.10006,
  title  = {Improving Controller Generalization with Dimensionless Markov Decision Processes},
  author = {Valentin Charvet and Sebastian Stein and Roderick Murray-Smith},
  journal= {arXiv preprint arXiv:2504.10006},
  year   = {2025}
}

备注

11 pages, 5 figures