选项即响应:在多智能体强化学习中 grounding 行为层级
机器学习
2020-07-13 v3 人工智能
多智能体系统
神经与进化计算
机器学习
摘要
本文研究多智能体博弈中的泛化问题,其中智能体的泛化能力可通过与训练期间未遇到的对手对战来评估。我们提出了两款具有隐藏信息与复杂、非传递性奖励结构(类似石头/剪刀/布)的新博弈。结果表明,当前大多数深度强化学习方法无法高效探索策略空间,从而学到对未见对手泛化能力差的策略。我们随后提出了一种新颖的层级智能体架构,其层级扎根于博弈的博弈论结构——顶层选择针对对手的策略性响应,底层将其实现为对原始动作的策略。这种 grounding 促进了层级间的信用分配。我们的实验表明,所提出的层级智能体能够泛化至未见对手,而常规基线方法完全无法泛化。
引用
@article{arxiv.1906.01470,
title = {Options as responses: Grounding behavioural hierarchies in multi-agent RL},
author = {Alexander Sasha Vezhnevets and Yuhuai Wu and Remi Leblond and Joel Z. Leibo},
journal= {arXiv preprint arXiv:1906.01470},
year = {2020}
}
备注
First two authors contributed equally