Q-Star 遇见可扩展后验采样:通过 HyperAgent 桥接理论与实践
机器学习
2024-06-17 v5 人工智能
机器学习
摘要
我们提出 HyperAgent,一种基于超模型框架的强化学习探索算法。HyperAgent 允许高效增量近似最优动作价值函数 () 的后验,无需共轭性,并遵循关于这些近似后验样本的贪心策略。我们证明 HyperAgent 在大规模深度强化学习基准测试中具有稳健性能。它能解决 Deep Sea 硬探索问题,其 episode 数量与问题规模最优缩放,并在 Atari 套件中展现出显著的效率提升。实现 HyperAgent 只需对成熟的深度强化学习框架(如 DQN)添加少量代码。我们在理论上证明,在表格假设下,HyperAgent 实现对数级每步计算复杂度,同时达到次线性遗憾,与已知最佳随机表格强化学习算法相匹配。
引用
@article{arxiv.2402.10228,
title = {Q-Star Meets Scalable Posterior Sampling: Bridging Theory and Practice via HyperAgent},
author = {Yingru Li and Jiawei Xu and Lei Han and Zhi-Quan Luo},
journal= {arXiv preprint arXiv:2402.10228},
year = {2024}
}
备注
Proceedings of the $\mathit{41}^{st}$ International Conference on Machine Learning, Vienna, Austria. PMLR 235, 2024. Copyright 2024 by the author(s). Invited talk in Informs Optimization Conference 2024 and International Symposium on Mathematical Programming 2024