基于策略差异估计的Tabular强化学习中的样本复杂度降低
机器学习
2024-06-12 v1 人工智能
摘要
本文研究了在情境式bandits和Tabular强化学习(RL)中进行纯探索问题的非渐近样本复杂度:以高概率从一组策略中识别出ε-最优策略。现有工作表明,可通过仅估计个体策略行为差异来识别最佳策略,这比直接估计每个策略的行为更划算。然而,已知最好的RL复杂度未能利用这一点,而是直接估计每个策略的行为。是否只需估计策略行为差异即可?我们对情境式bandits给出肯定回答,但对Tabular RL则是否定回答,显示出情境式bandits与RL之间的差异。然而,鼓舞人心的是,我们表明在RL中几乎只需估计策略差异即可:如果我们能够估计单个参考策略的行为,则只需估计任何其他策略与该参考策略的偏差。我们开发了一个实现这一原则的数据算法,并获得了据称最紧的Tabular RL样本复杂度界。
引用
@article{arxiv.2406.06856,
title = {Sample Complexity Reduction via Policy Difference Estimation in Tabular Reinforcement Learning},
author = {Adhyyan Narang and Andrew Wagenmaker and Lillian Ratliff and Kevin Jamieson},
journal= {arXiv preprint arXiv:2406.06856},
year = {2024}
}
备注
59 pages, 2 Figures