面向临时组队的智能体策略即时自适应
机器学习
2022-03-16 v1 人工智能
计算机科学与博弈论
机器学习
摘要
在协作环境中训练智能体有望实现能够在现实世界中与人类(及其他智能体)有效交互的AI智能体。多智能体强化学习(MARL)有潜力实现这一目标,已在一系列挑战性问题中展现出成功。然而,尽管这些进展意义重大,绝大多数研究聚焦于自博弈范式。这常导致协调问题,源于智能体在学习利用自身对弈时的任意约定。这意味着即便最强的自博弈智能体也可能与其他智能体(包括同一算法的其他初始化)产生极低的跨博弈表现。本文提出通过利用对他者策略的后验信念,即时自适应智能体策略来解决该问题。具体而言,我们考虑从一组先前训练好的智能体中选择一个策略,与未知伙伴对弈的问题。我们提出对经典统计技术吉布斯采样的一种扩展,以更新关于其他智能体的信念并获得接近最优的临时组队性能。尽管简单,我们的方法能在极具挑战的纸牌游戏Hanabi中与未见过的伙伴实现强跨博弈,无需事先知晓伙伴策略即达成成功的临时协调。
引用
@article{arxiv.2203.08015,
title = {On-the-fly Strategy Adaptation for ad-hoc Agent Coordination},
author = {Jaleh Zand and Jack Parker-Holder and Stephen J. Roberts},
journal= {arXiv preprint arXiv:2203.08015},
year = {2022}
}
备注
Extended abstract published in AAMAS 2022