The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
机器学习
2025-02-12 v2 信息论
math.IT
最优化与控制
机器学习
摘要
我们研究了在平均奖励马尔可夫决策过程(MDP)中使用插拔方法学习最优策略的样本复杂度。插拔方法构建模型估计,然后在估计模型中计算平均奖励最优策略。尽管插拔方法代表了最简单的方法,但从未进行过理论分析。与更熟悉的折扣MDP归约方法不同,插拔方法无需先验问题信息或参数调优。我们的结果填补了这一空白,解决了先前方法的局限性,我们展示了插拔方法在多个熟悉的设置中达到了最优,无需使用先验知识。具体来说,它在没有知道直径或均匀混合时间的情况下,实现了最优的直径和混合基于的样本复杂度和。我们也获得了基于跨度的插拔方法的界限,并用特定于算法的下界补充它们,表明它们是不可改进的。我们的结果需要新技术来分析长期问题,这些技术可能广泛有用,也改进了折扣插拔方法的结果,消除了有效时域相关的样本大小限制,获得了在没有奖励扰动的全范围样本大小下的第一个最优复杂度界限。
引用
@article{arxiv.2410.07616,
title = {The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis},
author = {Matthew Zurek and Yudong Chen},
journal= {arXiv preprint arXiv:2410.07616},
year = {2025}
}
备注
Accepted to 36th International Conference on Algorithmic Learning Theory (ALT 2025)