通过逆多智能体强化学习发现集体行为中的个体奖励
机器学习
2023-05-19 v1 人工智能
多智能体系统
摘要
在诸如鱼群和细菌菌落等复杂动力系统的集体行为中发现个体目标是一项长期挑战。逆强化学习是解决该挑战的有力方法,但其在涉及连续状态-动作空间与多个交互智能体的动力系统中的适用性一直受限。在本研究中,我们通过引入一种离策略逆多智能体强化学习算法(IMARL)来解决此挑战。我们的方法将 ReF-ER 技术与引导代价学习相结合。通过利用示范数据,我们的算法自动揭示奖励函数并为智能体学习有效策略。通过大量实验,我们证明所提策略捕捉了提供数据中观察到的行为,并在包括 OpenAI gym 中的单智能体模型与鱼群行为的多智能体模型等问题域上取得有前景的结果。本研究显示,所提 IMARL 算法是从其组成成分视角理解集体动力学的重要一步,并展示了其作为研究展现集体行为的复杂物理系统工具的价值。
引用
@article{arxiv.2305.10548,
title = {Discovering Individual Rewards in Collective Behavior through Inverse Multi-Agent Reinforcement Learning},
author = {Daniel Waelchli and Pascal Weber and Petros Koumoutsakos},
journal= {arXiv preprint arXiv:2305.10548},
year = {2023}
}