中文

重优化近乎求解弱耦合马尔可夫决策过程

最优化与控制 2024-05-08 v2 概率论

摘要

我们提出一种称为 LP-更新策略的新策略,用于求解有限时域弱耦合马尔可夫决策过程。后者可视为多约束多臂老虎机,并推广了经典的 restless bandit 问题。我们的解基于周期性地重新求解原问题的一个松弛版本,该版本可表述为一个线性规划(LP)。当问题由 NN 个统计相同的子分量构成时,我们证明 LP-更新策略以 O(T2/N)O(T^2/\sqrt{N}) 的速率渐近最优。若问题满足某种遍历性,该速率可提升至 O(T/N)O(T/\sqrt{N});若问题非退化,则可提升至 O(1/N)O(1/N)。非退化性的定义推广了 restless bandit 中的同名概念。利用该性质,我们还提升了 LP-更新策略的计算效率。我们在随机生成的例子以及一个广义应聘者筛选问题上展示了策略的性能,表明其优于现有启发式方法。

关键词

引用

@article{arxiv.2211.01961,
  title  = {Reoptimization Nearly Solves Weakly Coupled Markov Decision Processes},
  author = {Nicolas Gast and Bruno Gaujal and Chen Yan},
  journal= {arXiv preprint arXiv:2211.01961},
  year   = {2024}
}

备注

29 pages. Preprint