基于后验采样的 Q-learning
机器学习
2025-10-30 v3
摘要
贝叶斯后验采样技术在许多探索-利用(exploration-exploitation)场景中展现出了优越的经验性能。然而,对其的理论分析仍具挑战,尤其是在强化学习等复杂场景中。本文提出了基于后验采样的 Q-learning(PSQL),这是一种简单的基于 Q-learning 的算法,其利用 Q 值上的高斯后验进行探索,类似于多臂老虎机(multi-armed bandit)设定中流行的 Thompson Sampling 算法。我们证明,在表格型情景式 MDP 设定下,PSQL 实现了 的遗憾界,与已知的 下界紧密匹配。此处,S、A 表示底层马尔可夫决策过程(MDP)中的状态数和动作数,且 ,其中 K 为回合数,H 为规划视界。本文针对将后验采样与动态规划及基于 TD-learning 的强化学习算法相结合所面临的核心挑战,提供了若干新的技术见解,并提出了解决这些困难的新思路。我们希望这能为在更复杂的强化学习场景中分析这一高效且重要的算法技术奠定起点。
引用
@article{arxiv.2506.00917,
title = {Q-learning with Posterior Sampling},
author = {Priyank Agrawal and Shipra Agrawal and Azmat Azati},
journal= {arXiv preprint arXiv:2506.00917},
year = {2025}
}
备注
Updated version