面向全局最优协作强化学习的动作依赖图
机器学习
2025-06-03 v1 人工智能
系统与控制
系统与控制
最优化与控制
摘要
动作依赖的个体策略在决策过程中同时考虑环境状态和其他智能体的动作,已成为在多智能体强化学习(MARL)中实现全局最优的一种极具前景的范式。然而,现有文献通常采用自回归的动作依赖策略,其中每个智能体的策略依赖于所有前序智能体的动作。这种表述在智能体数量增加时会产生巨大的计算复杂度,从而限制了可扩展性。在本工作中,我们考虑了一类更广义的动作依赖策略,它们不一定遵循自回归形式。我们提出使用“动作依赖图(ADG)”来建模智能体间的动作依赖关系。在由协作图构建的MARL问题背景下,我们证明了只要ADG满足协作图指定的特定条件,具有稀疏ADG的动作依赖策略即可实现全局最优。基于这一理论基础,我们开发了一种具有全局最优保证的表格策略迭代算法。此外,我们将该框架集成到几种SOTA算法中,并在复杂环境中进行了实验。实证结果肯定了我们的方法在更一般场景中的鲁棒性和适用性,凸显了其在应对更广泛MARL挑战方面的潜力。
引用
@article{arxiv.2506.00797,
title = {Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning},
author = {Jianglin Ding and Jingcheng Tang and Gangshan Jing},
journal= {arXiv preprint arXiv:2506.00797},
year = {2025}
}