通过无量纲化马尔可夫决策过程提高控制器的泛化能力
机器学习
2025-04-15 v1
摘要
基于强化学习训练的控制器倾向于高度专业化,因而在测试环境与训练环境不同时泛化能力差。我们提出一种基于模型的方法,通过无量纲化状态-动作空间训练世界模型和策略,来提高泛化能力。为此,我们引入了无量纲化马尔可夫决策过程(-MDP):即在上下文型马尔可夫决策过程中,对状态和动作空间应用布拉金- 定理进行无量纲化。此程序诱导出随底层动态上下文变化而等价的策略。我们提供了该方法的通用框架,并应用于基于高斯过程模型的模型基策略搜索算法。我们在仿真的作动摆锤和小车摆姿系统上演示了该方法的可行性,其中在单一环境上训练的策略对上下文分布的偏移具有鲁棒性。
引用
@article{arxiv.2504.10006,
title = {Improving Controller Generalization with Dimensionless Markov Decision Processes},
author = {Valentin Charvet and Sebastian Stein and Roderick Murray-Smith},
journal= {arXiv preprint arXiv:2504.10006},
year = {2025}
}
备注
11 pages, 5 figures