中文

基于混合目标的好奇驱动多智能体探索

人工智能 2022-11-01 v1 机器学习 多智能体系统

摘要

内在奖励已日益用于缓解单智能体强化学习中的稀疏奖励问题。这些内在奖励鼓励智能体寻找新颖体验,引导智能体在缺乏外在奖励的情况下充分探索环境。好奇驱动探索是一种简单而高效的方法,它将这种新颖性量化为智能体好奇模块(一个内部神经网络,经训练可根据当前状态与动作预测下一状态)的预测误差。然而,我们在此表明,在稀疏奖励协作多智能体环境中,朴素地使用该好奇驱动方法引导探索并不能一致地带来改进结果。好奇驱动探索的直接多智能体扩展仅考虑个体或集体新颖性,因而无法提供协作多智能体任务学习中至关重要的、独特且协作的内在奖励信号。本工作中,我们提出一种好奇驱动多智能体探索方法,其混合目标在于激励智能体以个体与集体均新颖的方式探索环境。首先,我们开发了一个双头好奇模块,其第一头经训练预测对应智能体的下一观测,第二头预测下一联合观测。其次,我们将内在奖励公式设计为该好奇模块的个体与联合预测误差之和。我们通过实验表明,我们的好奇模块架构与内在奖励公式的组合比基线方法更高效地引导多智能体探索,从而在稀疏奖励协作导航环境中为MARL算法提供最佳性能提升。

关键词

引用

@article{arxiv.2210.16468,
  title  = {Curiosity-Driven Multi-Agent Exploration with Mixed Objectives},
  author = {Roben Delos Reyes and Kyunghwan Son and Jinhwan Jung and Wan Ju Kang and Yung Yi},
  journal= {arXiv preprint arXiv:2210.16468},
  year   = {2022}
}