联合 MDP 及其在耦合动力学环境中的强化学习
机器学习
2026-03-10 v1 最优化与控制
摘要
强化学习中许多分布量在动作上具有内在的联合性,包括间隙的分布和优势概率的分布。然而,经典马尔可夫决策过程(MDP)形式仅指定边缘律,留下了在多个可能动作下,对一个状态下的联合 counterfactual one-step 结果的联合律未指定。我们研究具有多动作生成接口的耦合动力学环境,该接口可以在共享外生随机性下抽样多个动作的 counterfactual one-step 结果。我们提出联合 MDP(JMDPs)作为此类环境的形式化方法,通过在 MDP 中增添多动作抽样转换模型来指定一个 one-step counterfactual 结果的耦合,同时保持标准 MDP 交互作为边缘观察。我们采用并形式化一种 one-step 耦合范式,其中跨动作的依赖限制在查询状态下的即时 counterfactual 结果。在该范式下,我们推导 次序回报矩的 Bellman 算子,提供具有收敛保证的动态规划和增量算法。
关键词
引用
@article{arxiv.2603.06946,
title = {Joint MDPs and Reinforcement Learning in Coupled-Dynamics Environments},
author = {Ege C. Kaya and Mahsa Ghasemi and Abolfazl Hashemi},
journal= {arXiv preprint arXiv:2603.06946},
year = {2026}
}
备注
25 pages, 7 figures