中文

集中式自适应抽样:独立多智能体策略协同训练的可靠性

机器学习 2026-05-14 v2

摘要

独立于策略的策略梯度算法在多智能体强化学习(MARL)中被广泛应用于合作型和无冲突游戏,但已知在每个智能体的 individual 策略梯度指向非最优联合均衡时会收敛到亚最优解。超越先前工作,我们观察到即使每个智能体的 expected individual 策略梯度指向最优联合解,亚最优收敛仍然可能发生。在收集有限轨迹后,独立动作抽样的随机性会导致联合数据分布偏离预期的联合on-policy分布。这种相对于联合on-policy分布的抽样误差会产生不准确的梯度估计,导致智能体亚最优收敛。我们假设通过协调动作选择来减少联合抽样误差,这将增加MARL中策略梯度学习可靠性(即收敛到最优联合策略的概率)。为测试此假设,我们首先引入一种自适应动作抽样方法,以减少集中训练、分散执行(setting下)的联合抽样误差。我们的 методCooperative Sampling Error Reduction (CoSER)持续适应集中行为策略,使联合动作中那些相对于当前联合策略抽样不足的动作获得更高概率。我们随后在多样化的多智能体游戏上经验评估CoSER,证明(1)CoSER比独立on-policy抽样更高效地减少联合抽样误差,(2)这种减少提高了独立策略梯度算法的可靠性。

关键词

引用

@article{arxiv.2508.01049,
  title  = {Centralized Adaptive Sampling for Reliable Co-Training of Independent Multi-Agent Policies},
  author = {Nicholas E. Corrado and Josiah P. Hanna},
  journal= {arXiv preprint arXiv:2508.01049},
  year   = {2026}
}

备注

RLC 2026