中文

面向协作深度多智能体强化学习的条件乐观探索

机器学习 2023-07-17 v2 多智能体系统

摘要

高效探索在协作深度多智能体强化学习(MARL)中至关重要。本工作提出一种基于顺序动作计算方案思想、有效促进协作探索的方法。其高层直觉在于,为进行基于乐观的探索,若每个智能体的乐观估计捕捉到与其他智能体的结构化依赖关系,智能体便会探索协作策略。假设智能体在\textit{每个环境时间步}按先后顺序计算动作,我们提供一种视角,将 MARL 视为树搜索迭代,将智能体看作搜索树不同深度的节点。受理论可靠的树搜索算法 UCT(Upper Confidence bounds applied to Trees)启发,我们提出称为条件乐观探索(COE)的方法。COE 利用源自全局状态及前序智能体联合动作访问次数的动作条件乐观奖励,增强每个智能体的状态-动作价值估计。COE 在训练期间执行、部署时关闭,因而兼容任意用于集中训练分散执行的价值分解方法。跨多个协作 MARL 基准的实验表明,COE 在难探索任务上优于当前最优探索方法。

关键词

引用

@article{arxiv.2303.09032,
  title  = {Conditionally Optimistic Exploration for Cooperative Deep Multi-Agent Reinforcement Learning},
  author = {Xutong Zhao and Yangchen Pan and Chenjun Xiao and Sarath Chandar and Janarthanan Rajendran},
  journal= {arXiv preprint arXiv:2303.09032},
  year   = {2023}
}

备注

Accepted at UAI 2023