中文

通过建议共享实现多智能体强化学习中的集体福利

多智能体系统 2025-06-17 v2 人工智能 机器学习

摘要

在人类社会中,自身利益与集体福利之间的冲突往往阻碍了实现共享福利的努力。公地悲剧和社会困境等相关概念在日常生活中频繁出现。随着人工智能体日益成为人类的自主代理,我们提出了一种新颖的多智能体强化学习(MARL)方法来解决这一问题——即学习策略以最大化集体回报,即使个体智能体的利益与集体利益相冲突。传统的合作 MARL 解决方案涉及共享奖励、值和策略,或设计内在奖励以鼓励智能体学习集体最优策略,与此不同,我们提出了一种新颖的 MARL 方法,其中智能体交换动作建议。与共享奖励、值或策略相比,我们的方法泄露更少的私有信息,同时无需设计内在奖励即可实现有效合作。我们的算法得到了理论分析的支持,该分析确立了集体目标与个体目标之间差异的界限,展示了共享建议如何使智能体的行为与集体目标保持一致。实验结果表明,我们的算法与依赖值或策略共享或内在奖励的基线方法相比具有竞争力的性能。

关键词

引用

@article{arxiv.2412.12326,
  title  = {Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing},
  author = {Yue Jin and Shuangqing Wei and Giovanni Montana},
  journal= {arXiv preprint arXiv:2412.12326},
  year   = {2025}
}

备注

Machine Learning (ECML-PKDD 2025 Journal Track)