中文

面向人-AI 协作的多样化约定

人工智能 2023-10-25 v1 机器学习 多智能体系统

摘要

约定对于合作多智能体游戏的强劲表现至关重要,因为它们使玩家无需显式通信即可就共享策略进行协调。遗憾的是,标准的多智能体强化学习技术(如自博弈)收敛到的约定任意且缺乏多样性,导致与新伙伴交互时泛化能力差。本工作中,我们提出一种生成多样化约定的技术:(1)在自博弈中最大化其奖励,同时(2)在与已发现约定进行交叉博弈时最小化其奖励,从而促使约定在语义上相异。为确保所学策略在交叉博弈的对抗性优化下仍诚实地行动,我们引入\emph{混合博弈}:初始状态由采样自博弈与交叉博弈转移随机生成,玩家从该初始状态学习最大化自博弈奖励。我们在包括 Overcooked 在内的多种多智能体协作游戏上分析了本技术的益处,发现该技术能适应人类约定,在与真实用户配对时超越人类水平表现。

关键词

引用

@article{arxiv.2310.15414,
  title  = {Diverse Conventions for Human-AI Collaboration},
  author = {Bidipta Sarkar and Andy Shih and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2310.15414},
  year   = {2023}
}

备注

25 pages, 9 figures, 37th Conference on Neural Information Processing Systems (NeurIPS 2023)