MOMA-AC:面向连续多目标多智能体强化学习的基于偏好的演员-评论家框架
机器学习
2025-11-25 v1 人工智能
摘要
本文针对多目标多智能体强化学习(MOMARL)中的关键缺口,提出首个专为连续状态与动作空间设计的内循环演员-评论家框架:Multi-Objective Multi-Agent Actor-Critic(MOMA-AC)。该框架基于单目标、单智能体算法,分别实例化为 Twin Delayed Deep Deterministic Policy Gradient(TD3)和 Deep Deterministic Policy Gradient(DDPG),得到 MOMA-TD3 和 MOMA-DDPG。该框架结合多头演员网络、集中评论家和目标偏好条件化架构,使单个神经网络能够编码连续 MOMARL 环境中所有智能体在相互冲突目标下的 Pareto 前沿的最优折中策略。我们还概述了针对连续 MOMARL 的自然测试套件,方法是将现有的多智能体单目标物理模拟器与其多目标单智能体对应用。评估合作 locomotion 任务中的表现,我们表明该框架在预期效用和超体积(hypervolume)方面相对于外循环和独立训练基线实现统计显著性提升,同时表现出随智能体数量增加而保持稳定的可扩展性。这些结果表明,该框架是面向连续多智能体域中稳健、可扩展多目标策略学习的基础性步骤。
引用
@article{arxiv.2511.18181,
title = {MOMA-AC: A preference-driven actor-critic framework for continuous multi-objective multi-agent reinforcement learning},
author = {Adam Callaghan and Karl Mason and Patrick Mannion},
journal= {arXiv preprint arXiv:2511.18181},
year = {2025}
}
备注
23 pages, 5 figures