中文

用于多智能体强化学习的深层网络 Q 向量方案

人工智能 2024-06-13 v1 多智能体系统

摘要

多智能体强化学习(Multi-agent reinforcement learning, MARL)因其能够促进复杂环境中的学习而成为重要的研究主题。在多智能体任务中,状态-动作价值(通常称为 Q 值)因各智能体的独立奖励而有所不同,导致形成 Q 向量。确定最优政策具有挑战性,因为这不仅仅涉及最大化单个 Q 值。诸如纳什均衡等多种最优政策已在此背景下受到研究。诸如纳什 Q 学习和纳什演员-评论家等算法在这些场景中表现出色。本文通过提出一种基于深层 Q 网络(DQN)的算法,能够学习各种 Q 向量,采用 Max、纳什和 Maximin 策略。在双臂机器人协作提举锅子环境中,证明了该方法的有效性。

关键词

引用

@article{arxiv.2406.07848,
  title  = {Multi-agent Reinforcement Learning with Deep Networks for Diverse Q-Vectors},
  author = {Zhenglong Luo and Zhiyong Chen and James Welsh},
  journal= {arXiv preprint arXiv:2406.07848},
  year   = {2024}
}