中文

关于去中心化策略-配置混合与行为协调政策等价性

最优化与控制 2026-05-19 v2

摘要

受限去中心化团队问题的表述是许多合作多智能体系统的良好模型。约束性质使得在求解最优解时需要随机化——过去的研究表明,团队中的联合随机化在一般情况下是获得(强)拉格朗日对偶性所必需的,但有关随机化的更深入理解仍然存在。对于具有Borel隐藏状态、可数观测值和有限动作的部分观测多智能体系统,我们证明了以下内容:\textit{i})独立随机化的去中心化策略配置——无论是行为型还是纯型——与去中心化行为策略配置诱导相同的占用测度(在联合历史与联合动作对上);以及\textit{ii})联合随机化的行为与纯去中心化策略配置诱导相同的占用测度。限于有限观测,我们还证明了去中心化策略配置(包括纯型和行为型)的联合混合以及基于常见信息的行为协调政策(也称为它们的混合)诱导相同的占用测度。这一结果概括了过去显示纯去中心化策略配置与纯协调政策等价的研究。这些结果可用于进一步发展拉格朗日对偶性、最优行为协调政策所需的最小随机化数量,以及能够找到近似最优解的学习方案。

关键词

引用

@article{arxiv.2504.12635,
  title  = {On Equivalence Between Decentralized Policy-Profile Mixtures and Behavioral Coordination Policies in Multi-Agent Systems},
  author = {Nouman Khan and Vijay G. Subramanian},
  journal= {arXiv preprint arXiv:2504.12635},
  year   = {2026}
}