中文

受约束的元无关强化学习

机器学习 2024-06-21 v1

摘要

元强化学习(Meta-Reinforcement Learning)旨在获取元知识,以便快速适应多样化任务。然而,在实际环境中将这些策略应用到实际环境中,面临在快速适应性与遵守环境约束之间取得平衡的重大挑战。我们提出的新方法——受约束模型无关元学习(Constraint Model Agnostic Meta Learning, 简称 C-MAML)将元学习与约束优化相结合,以解决这一挑战。C-MAML 在训练阶段将任务特定的约束直接融入其元算法框架,实现对新任务的快速且高效的任务适应。这种融合结果产生更安全的初始参数,以学习新任务。我们在仿真 locomotion 场景中对 wheeled robot 任务(任务复杂度各不相同)展示了 C-MAML 的有效性,凸显了其在动态环境中的实用性与鲁棒性。

关键词

引用

@article{arxiv.2406.14047,
  title  = {Constrained Meta Agnostic Reinforcement Learning},
  author = {Karam Daaboul and Florian Kuhm and Tim Joseph and J. Marius Zoellner},
  journal= {arXiv preprint arXiv:2406.14047},
  year   = {2024}
}