无模型对手塑造
人工智能
2022-11-07 v2 多智能体系统
摘要
在一般和博弈中,自利学习智能体的交互通常导致集体最坏结果,例如迭代囚徒困境(IPD)中的背叛-背叛。为克服这一点,一些方法如具备对手学习感知的学习(LOLA)塑造其对手的学习过程。然而,这些方法存在短视,因为只能预期少量步数;是不对称的,因为它们将其他智能体视为朴素学习者;并且需要使用高阶导数的白盒访问对手可微分学习算法来计算。为解决这些问题,我们提出无模型对手塑造(M-FOS)。M-FOS 在一个元博弈中学习,其中每个元步是底层内部博弈的一幕。元状态由内部策略组成,元策略产生用于下一幕的新内部策略。M-FOS 随后使用通用的无模型优化方法学习实现长视野对手塑造的元策略。在经验上,M-FOS 近乎最优地利用朴素学习者和文献中其他更复杂的算法。例如,据我们所知,它是首个在 IPD 中学习著名的零行列式(ZD)勒索策略的方法。在相同设定下,M-FOS 在元自博弈下导致社会最优结果。最后,我们展示 M-FOS 可扩展到高维设定。
引用
@article{arxiv.2205.01447,
title = {Model-Free Opponent Shaping},
author = {Chris Lu and Timon Willi and Christian Schroeder de Witt and Jakob Foerster},
journal= {arXiv preprint arXiv:2205.01447},
year = {2022}
}
备注
ICML 2022 camera ready version. Code: https://github.com/luchris429/Model-Free-Opponent-Shaping