中文

Provably Efficient and Agile Randomized Q-Learning

机器学习 2026-02-05 v2

摘要

虽然基于贝叶斯的探索在模型基准强化学习中常常显示出优于基于奖励的方法的实证性能,但其在无模型情境下的理论理解仍有限。现有可证明算法要么 suffer 计算不可行性,要么依赖阶段性策略更新,这会降低响应性并减缓学习进程。在本文中,我们提出一种新型Q学习算法,称为RandomizedQ,将基于抽样的探索与敏捷的、逐步的策略更新相结合,用于episodic表格型强化学习。我们建立了O~(H5SAT)\widetilde{O}(\sqrt{H^5SAT})的诚实度上界,其中S为状态数,A为动作数,H为episode长度,T为总episode数。此外,我们在optimal Q函数上轻度的正亚最优条件下,给出对数诚实度上界。实验方面,RandomizedQ在标准基准测试中,相对于现有Q学习变体表现出色,无论是基于奖励的还是基于贝叶斯的探索。

关键词

引用

@article{arxiv.2506.24005,
  title  = {Provably Efficient and Agile Randomized Q-Learning},
  author = {He Wang and Xingyu Xu and Yuejie Chi},
  journal= {arXiv preprint arXiv:2506.24005},
  year   = {2026}
}