中文

去中心化随机控制的近似与学习:近最优有限窗策略

最优化与控制 2026-05-04 v1 概率论

摘要

去中心化随机控制问题因信息结构相关的细微差别而难以研究,这些差别阻止了许多经典随机控制方法的适用。本文考虑在两种相关信息结构下的此类问题,具有一般标准巴尔尔空间。(a)一步延迟信息共享模式(OSDISP),其中代理之间共享其信息存在一小段延迟;(b)K 步周期性信息共享模式(KSPISP),其中信息按周期共享。已知 OSDISP 和 KSPISP 问题可归约为集中式控制,其中代理从集中式控制器的角度观察问题,该控制器使用公共信息来指定函数值动作(局部策略),这些策略将每个代理的私有信息映射到原始问题中的最优动作。我们提供了对 KSPISP 和 OSDISP 问题的严格近似结果和性能界限,这些结果源于用有限滑动窗的信息替换完整公共信息,并证明了此类策略的近最优性。后者取决于期望总变差下的预测稳定性条件。作为进一步贡献,我们展示,在提供的信息结构下,相应的 Q 学习算法(在量化或有限记忆形式中)在渐近上收敛到近最优解。虽然文献中已 presented some restrictive and hypothetical conditions,但我们的贡献因此提供了据我们所知,第一个明确条件和严格近似与学习结果,用于具有一般空间的此类去中心化问题。

关键词

引用

@article{arxiv.2605.00160,
  title  = {Approximations and Learning for Decentralized Stochastic Control and Near Optimal Finite Window Policies},
  author = {Omar Mrani-Zentar and Serdar Yuksel},
  journal= {arXiv preprint arXiv:2605.00160},
  year   = {2026}
}

备注

arXiv admin note: text overlap with arXiv:2408.13828