流动无回报多臂老虎机的最优控制:一种机器学习方法
机器学习
2026-05-08 v2
摘要
我们提出了一种新的机器学习框架,用于解决具有仿射或二次状态变量状态方程的流动无回报多臂老虎机问题 (FRMABP)。通过建立 FRMABP 的基本性质,我们开发了一种高效的数值算法,通过解决具有不同初始状态的多个实例生成全面的训练集。进一步地,通过对特征向量应用非线性变换来增强训练集,利用 FRMABP 的结构属性。随后使用带有超平面分割的最优分类树 (OCT-H) 学习时间依赖的状态反馈策略。我们在机器维护、流行病控制和渔业控制问题上测试了该方法,表明该方法能产生高质量的状态反馈策略。此外,一旦策略被学习,其相对于直接数值算法的速度提升可达数千万倍。
引用
@article{arxiv.2502.03725,
title = {Optimal Control of Fluid Restless Multi-armed Bandits: A Machine Learning Approach},
author = {Dimitris Bertsimas and Cheol Woo Kim and José Niño-Mora},
journal= {arXiv preprint arXiv:2502.03725},
year = {2026}
}