面向无限视角平均奖励线性混合 MDP 的学习算法
机器学习
2024-10-22 v1 最优化与控制
摘要
本文提出了一种针对无限视角平均奖励线性混合型马尔可夫决策过程(MDP)的可计算可行算法。我们的方法在 Bellman 最优条件下实现 nearly-minimax 最优 regret 上界,具体为 ,其中 为最优偏置函数 的跨度, 为特征映射的维数。我们的算法应用了最近发展的在贴现奖励 MDP 近似上运行价值迭代并通过跨度进行裁剪的技术。我们证明了即使进行裁剪操作,价值迭代过程也会收敛。此外,我们表明即使在裁剪下,由于随机转移导致的方差项也可以被界定。结合基于加权岭回归的参数估计方案,这导致 nearly-minimax 最优 regret 的保证。
引用
@article{arxiv.2410.14992,
title = {Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span},
author = {Woojin Chae and Kihyuk Hong and Yufan Zhang and Ambuj Tewari and Dabeen Lee},
journal= {arXiv preprint arXiv:2410.14992},
year = {2024}
}