在线逐集凸型强化学习
机器学习
2025-05-13 v1 机器学习
摘要
我们研究了在离散时域马尔可夫决策过程(MDP)中的在线学习问题,这种设置称为凹效用强化学习(CURL)问题。该设置将RL从线性损失推广到作用于智能体策略所诱导的状态-动作分布上的凸损失。CURL的非线性使经典贝尔曼方程式失效,要求新的算法方法。我们引入了第一个在没有对转换函数的任何先验知识的情况下,为在线CURL实现近最优 regret下界的算法。为此,我们使用可变约束集的在线镜像梯度算法,并设计了谨慎的探索奖励。随后,我们首次解决了CURL的bandit版本,其中唯一的反馈是作用于智能体策略所诱导的状态-动作分布上的目标函数值。通过将来自bandit凸优化技术 adapted to the MDP setting,我们实现了对这一更具挑战性问题的亚线性 regret下界。
引用
@article{arxiv.2505.07303,
title = {Online Episodic Convex Reinforcement Learning},
author = {Bianca Marin Moreno and Khaled Eldowa and Pierre Gaillard and Margaux Brégère and Nadia Oudjane},
journal= {arXiv preprint arXiv:2505.07303},
year = {2025}
}