中文

MetaCURL:非平稳凹效用强化学习

机器学习 2024-05-31 v1 概率论 统计理论 机器学习 统计理论

摘要

我们探索在非平稳环境(变化的损失和概率转移)中的回合制无环马尔可夫决策过程中的在线学习。我们的重点是凹效用强化学习问题(CURL),它是经典RL的扩展,用于处理由智能体策略引起的状态-动作分布中的凸性能准则。虽然各种机器学习问题可以写成CURL,但其非线性使得传统的贝尔曼方程无效。尽管最近有解决经典CURL的方案,但没有一个解决非平稳MDP。本文介绍了MetaCURL,第一个用于非平稳MDP的CURL算法。它采用元算法,在不同区间上运行多个黑盒算法实例,通过睡眠专家框架聚合输出。关键障碍是由于MDP不确定性导致的部分信息。在概率转移的部分信息下(不确定性和非平稳性仅来自外部噪声,独立于智能体状态-动作对),我们在没有MDP变化先验知识的情况下实现了最优动态遗憾。与RL的方法不同,MetaCURL处理完全对抗性损失,而不仅仅是随机损失。我们相信,我们使用专家管理非平稳性的方法可能引起RL社区的兴趣。

关键词

引用

@article{arxiv.2405.19807,
  title  = {MetaCURL: Non-stationary Concave Utility Reinforcement Learning},
  author = {Bianca Marin Moreno and Margaux Brégère and Pierre Gaillard and Nadia Oudjane},
  journal= {arXiv preprint arXiv:2405.19807},
  year   = {2024}
}