中文

策略在学习随机最优控制中的快速政策后悔收敛

最优化与控制 2026-05-27 v1 机器学习

摘要

在现代运营环境中,策略学习面临数据有限与大规模甚至连续状态与动作空间之间的根本性张力。我们研究基于价值的随机最优控制中的策略学习:部署由最优动作价值函数 QQ^* 估计所诱导的贪心策略,并以后悔度衡量其性能。经验成功的这一方法迫切需要对实现快速后悔收敛的统计结构进行洞察。在连续动作空间中,快速策略学习由三种几何结构所致:增长指数 pp,量度 QQ^* 如何迅速区分次优动作与其最大化者;边际质量指数 mm,控制部署质量落在弱增长状态上的程度;以及动作相关性指数 qq,衡量 QQ^* 估计误差在动作间的平滑性。给定 n1/2n^{-1/2} 精度的 QQ^* 估计器,我们证明 minimax 最优策略后悔收敛速率为\n\nΘ~(nmin{p2(pq),m+12m}), \widetilde{\Theta}\left( n^{-\min\left\{\frac{p}{2(p-q)},\frac{m+1}{2m}\right\}} \right), \n\n不计在边界两个区间之间的对数因子。指数 qq 至关重要:q>0q>0 可实现快于 n1/2n^{-1/2} 的后悔。这一区间在运营应用中是自然的。特别是,我们在动态库存控制和服务分配等示例中验证了 q>0q>0,而这一快速速率 regime 的机制超出这些具体情形。

关键词

引用

@article{arxiv.2605.26361,
  title  = {Fast Convergence of Policy Regret in Learning Stochastic Optimal Control},
  author = {Shengbo Wang and Jose Blanchet and Peter Glynn},
  journal= {arXiv preprint arXiv:2605.26361},
  year   = {2026}
}