通过贪婪镜像下降实现高效的基于模型的凹效用强化学习
最优化与控制
2023-12-01 v1 数据分析、统计与概率
机器学习
摘要
许多机器学习任务可以通过在生成占用度量的策略上最小化该占用度量的凸函数来解决。这些任务包括强化学习、模仿学习等。这一更通用的范式被称为凹效用强化学习问题(Concave Utility Reinforcement Learning, CURL)。由于 CURL 使经典的贝尔曼方程失效,它需要新的算法。我们引入了 MD-CURL,一种用于有限时域马尔可夫决策过程中 CURL 的新算法。MD-CURL 受镜像下降启发,并使用一种非标准正则化来实现收敛保证和简单的闭式解,消除了镜像下降方法中通常存在的计算昂贵的投影步骤需求。随后我们将 CURL 扩展到在线学习场景,并提出 Greedy MD-CURL,一种将 MD-CURL 适配于动态部分未知、基于回合的在线设置的新方法。与 MD-CURL 一样,在线版本 Greedy MD-CURL 具有较低的计算复杂度,同时根据底层动态可用信息的水平保证次线性甚至对数遗憾(regret)。
引用
@article{arxiv.2311.18346,
title = {Efficient Model-Based Concave Utility Reinforcement Learning through Greedy Mirror Descent},
author = {Bianca Marin Moreno and Margaux Brégère and Pierre Gaillard and Nadia Oudjane},
journal= {arXiv preprint arXiv:2311.18346},
year = {2023}
}