中文

通过观测增强的自博弈学习既有社会惯例

人工智能 2019-03-14 v3 计算机科学与博弈论

摘要

为了让人工智能体能与人类有效协调,它们必须与既有惯例保持一致(例如如何交通导航、使用何种语言、或与队友如何协调)。一个群体的惯例可视为协调博弈中均衡的一种选择。我们考虑如下问题:智能体在模拟环境中为协调博弈学习策略,随后在进入既有群体时使用该策略。当存在多种可能惯例时,我们表明通过多智能体强化学习(MARL)学习策略很可能找到在训练时获得高收益、却无法与所进入真实群体协调的策略。我们假设可获取少量真实惯例的行为样本,并表明可增强 MARL 目标以助其找到与真实群体惯例一致的策略。在文献中的三个环境——交通、通信与团队协调——中,我们观察到用少量模仿学习增强 MARL 极大提高了 MARL 所找到策略与既有社会惯例契合的概率。我们表明,即便在标准训练方法极少能找到智能体伙伴真实惯例的环境中,此方法依然有效。

关键词

引用

@article{arxiv.1806.10071,
  title  = {Learning Existing Social Conventions via Observationally Augmented Self-Play},
  author = {Adam Lerer and Alexander Peysakhovich},
  journal= {arXiv preprint arXiv:1806.10071},
  year   = {2019}
}

备注

Published in AAAI-AIES2019 - Best Paper