中文

去中心化元强化学习中集体开放式探索的涌现

多智能体系统 2024-05-08 v3 人工智能

摘要

近期工作已证明,在开放式任务分布上使用自博弈、通过元强化学习训练的智能体能够涌现出复杂的合作行为。尽管结果令人印象深刻,我们认为自博弈及其他集中式训练技术并不能准确反映自然界中通用集体探索策略的涌现方式:即通过去中心化训练且基于开放式任务分布。因此,本工作研究集体探索策略的涌现,其中多个智能体在开放式任务分布上元学习独立的循环策略。为此,我们引入了一种具有开放式程序化生成任务空间的新环境,该空间将采自五种不同任务类型的多个子任务动态组合,形成庞大的任务树分布。我们表明,在我们环境中训练的 decentralized 智能体在测试时面对新物体时表现出强大的泛化能力。此外,尽管训练期间从未被强制合作,智能体仍学到了集体探索策略,使其能解决训练时从未遇到过的新任务。我们进一步发现,智能体学到的集体探索策略可扩展至开放式任务设定,使其能解决深度达训练时所见两倍的任务树。我们的开源代码及智能体视频可在配套网站上找到。

关键词

引用

@article{arxiv.2311.00651,
  title  = {Emergence of Collective Open-Ended Exploration from Decentralized Meta-Reinforcement Learning},
  author = {Richard Bornemann and Gautier Hamon and Eleni Nisioti and Clément Moulin-Frier},
  journal= {arXiv preprint arXiv:2311.00651},
  year   = {2024}
}

备注

Published at the 2nd Agent Learning in Open-Endedness Workshop at NeurIPS 2023