基于离散奖励 MDP 近似的无限时段平均奖励线性 MDP 的强化学习
机器学习
2025-03-12 v3 机器学习
摘要
我们研究了基于线性马尔可夫决策过程(MDPs)的无限时段平均奖励强化学习问题。由于该问题的 Bellman 算子不是收缩映射,算法设计变得具有挑战性。以往方法要么 suffer 计算效率低下,要么需要对动态进行强假设(如 Ergodicity),才能实现 的 regret 界。本文提出了首个在不对动态作出强假设的情况下,即可实现 的 regret 界且计算复杂度为问题参数的多项式时间的算法。我们的做法通过选择合适的折扣因子,将平均奖励设置近似为折扣 MDP,然后应用乐观价值迭代。我们提出一种算法结构,通过乐观价值迭代规划非平稳策略,并在收集的数据中信息度量翻倍后遵循该策略。此外,我们引入了价值函数裁剪程序,以限制价值函数的跨度,从而提高样本效率。
引用
@article{arxiv.2405.15050,
title = {Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs},
author = {Kihyuk Hong and Woojin Chae and Yufan Zhang and Dabeen Lee and Ambuj Tewari},
journal= {arXiv preprint arXiv:2405.15050},
year = {2025}
}