中文

在变化环境中使用因子化状态表示学习鲁棒策略的课程

机器学习 2024-09-20 v2 人工智能

摘要

鲁棒策略使强化学习智能体能够有效地适应并在不可预测、动态且不断变化的现实世界环境中运行。因子化表示将复杂的状态和动作空间分解为不同的组件,可以改善策略学习中的泛化能力和样本效率。在本文中,我们探讨了使用因子化状态表示的智能体的课程如何影响所学策略的鲁棒性。我们通过实验展示了三种简单的课程,例如仅在回合之间改变具有最高遗憾值的变量,这些课程可以显著增强策略的鲁棒性,为复杂环境中的强化学习提供了实用的见解。

关键词

引用

@article{arxiv.2409.09169,
  title  = {Curricula for Learning Robust Policies with Factored State Representations in Changing Environments},
  author = {Panayiotis Panayiotou and Özgür Şimşek},
  journal= {arXiv preprint arXiv:2409.09169},
  year   = {2024}
}

备注

17th European Workshop on Reinforcement Learning (EWRL 2024)