中文

DCIR:用于多智能体强化学习的动态一致性内在奖励

机器学习 2023-12-12 v1

摘要

在多智能体系统中为每个智能体学习最优行为策略是一个至关重要且困难的问题。尽管多智能体强化学习取得了丰硕进展,但关于两个智能体是否应表现出一致行为的动态性挑战仍待深入探索。在本文中,我们提出一种新方法,使智能体能够通过利用内在奖励学习每个智能体的最优策略,从而学习其行为是否应与其他智能体保持一致。我们首先将行为一致性定义为两个智能体在给定相同观测时输出动作之间的差异。随后,我们引入动态一致性内在奖励(DCIR),以激励智能体感知其他智能体的行为并决定是否与其保持一致。最后,我们设计了一个动态缩放网络(DSN),在每个时间步为智能体提供可学习的缩放因子,以动态判定是否对一致行为给予奖励及奖励的幅度。我们在包括多智能体粒子环境、Google Research Football 和 StarCraft II 微操在内的多个环境中评估了 DCIR,证明了其有效性。

关键词

引用

@article{arxiv.2312.05783,
  title  = {DCIR: Dynamic Consistency Intrinsic Reward for Multi-Agent Reinforcement Learning},
  author = {Kunyang Lin and Yufeng Wang and Peihao Chen and Runhao Zeng and Siyuan Zhou and Mingkui Tan and Chuang Gan},
  journal= {arXiv preprint arXiv:2312.05783},
  year   = {2023}
}

备注

15 pages, 11 pages for main paper, 4 pages for supplementary