中文

延迟 MARL 中的结构等价性与学习动力学

机器学习 2026-05-07 v1

摘要

我们正式建立了观察延迟(OD)与动作延迟(AD)在合作部分可观测多智能体系统中的等价性,使用观察-动作历史。我们证明两种系统生成相同的可接受联合策略集合,其诱导的状态-动作-观察轨迹在分布上完全相同,从而在 Decentralized Partially Observable Markov Decision Processes(Dec-POMDPs)中产生相同的 optimal 解。这在形式上将现有的无限视角单智能体结果推广到任意视角部分可观测合作多智能体问题,并允许任何混合延迟配置化简为纯 OD 系统。我们进一步证明在 Transition-Independent MDPs(TI-MDPs)中,观察-动作历史化简为可管理的最小局部增广状态。然而,我们通过数值实验表明,尽管 optimal 解的空间在结构上是同构的,实际的学习动力学却根本不同。首先,使用最小局部增广状态,在转换不独立时等价性不再成立。其次,Temporal Difference(TD)算法中的操作约束和因果信用分配误差在不同 regime 下诱导不同的学习行为。最后,利用这种结构等价性规避这些学习挑战,我们展示了从 OD 成功实现 AD 的零样本策略迁移,为复杂延迟系统中的统一、高效求解方法铺平了道路。

关键词

引用

@article{arxiv.2605.04345,
  title  = {Structural Equivalence and Learning Dynamics in Delayed MARL},
  author = {Jules Sintes and Ana Bušić and Jiamin Zhu},
  journal= {arXiv preprint arXiv:2605.04345},
  year   = {2026}
}