连续奖励多臂_bandit博弈中的平均场均衡
多智能体系统
2021-05-11 v2 计算机科学与博弈论
机器学习
摘要
平均场博弈通过将大量智能体间的交互近似为平均效应,便于分析多智能体多臂_bandit(MAB)。现有多智能体 MAB 的平均场模型大多假设二值奖励函数,虽可处理但常不适用于实际场景。本文研究具有连续奖励函数的平均场_bandit博弈。具体而言,我们聚焦于推导平均场均衡(MFE)的存在性与唯一性,从而保障多智能体系统的渐近稳定性。为适配连续奖励函数,我们将所学奖励编码为智能体状态,该状态进而映射至其随机臂选择策略,并依据实际观测更新。我们证明状态演化是上半连续的,并由此得到 MFE 的存在性。由于马尔可夫分析主要针对离散状态情形,我们将随机连续状态演化转化为确定性常微分方程(ODE)。在此基础上,我们可刻画该 ODE 的压缩映射,以确保_bandit博弈存在唯一 MFE。大量评估验证了我们的 MFE 刻画,并展现出 MAB 问题的紧经验后悔界。
引用
@article{arxiv.2105.00767,
title = {Mean Field Equilibrium in Multi-Armed Bandit Game with Continuous Reward},
author = {Xiong Wang and Riheng Jia},
journal= {arXiv preprint arXiv:2105.00767},
year = {2021}
}
备注
IJCAI 2021