面向Gittins指数的表格与深度强化学习
机器学习
2025-08-26 v4 性能
机器学习
摘要
在多臂老虎机问题领域,已知Gittins指数策略在最大化拉动马尔可夫臂所获得的期望总折扣奖励方面是最优的。然而,在大多数现实场景中,马尔可夫状态转移概率是未知的,因此无法计算Gittins指数。此时可以求助于强化学习(RL)算法,通过探索状态空间来学习这些指数,同时利用所学知识以最大化收集的奖励。在这项工作中,我们提出了用于学习Gittins指数的表格(QGI)和Deep RL(DGN)算法,它们基于多臂老虎机问题的退休公式。与现有的学习Gittins指数的RL算法相比,我们的算法运行时间更短,所需存储空间更小(QGI中Q表更小,DGN中经验回放缓冲区更小),并且展现出对Gittins指数更好的经验收敛性。这使得我们的算法非常适合具有大状态空间的问题,并且是现有方法的可行替代方案。作为一项关键应用,我们展示了当作业分批可用且具有未知服务时间分布时,我们的算法在作业调度问题中最小化平均流时间的应用。
引用
@article{arxiv.2405.01157,
title = {Tabular and Deep Reinforcement Learning for Gittins Index},
author = {Harshit Dhankhar and Kshitij Mishra and Tejas Bodas},
journal= {arXiv preprint arXiv:2405.01157},
year = {2025}
}