中文

协作式多智能体约束 POMDP:强对偶性与基于近似信息状态的原始对偶强化学习

最优化与控制 2023-08-01 v1 系统与控制 系统与控制

摘要

我们研究团队设定下非策略性多智能体具有非对称信息时的分散式约束 POMDP 问题。当观测位于可数空间、动作选自有限空间且即时代价函数有界时,我们针对无限时域期望总折扣代价设定建立了强对偶性。此后,我们建立了其与公共信息和近似信息状态方法的联系。近似信息状态被刻画为独立于拉格朗日乘子向量,从而在学习过程中对乘子的调整无需新的表示。最后,借助循环与前馈神经网络作为函数逼近器,我们开发了一个基于集中训练分散执行(CTDE)和三时间尺度随机逼近的原始对偶多智能体强化学习(MARL)框架。

关键词

引用

@article{arxiv.2307.16536,
  title  = {Cooperative Multi-Agent Constrained POMDPs: Strong Duality and Primal-Dual Reinforcement Learning with Approximate Information States},
  author = {Nouman Khan and Vijay Subramanian},
  journal= {arXiv preprint arXiv:2307.16536},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2303.14932