利用非平稳多臂老虎机学习具有非平稳需求的重复古诺博弈
机器学习
2022-01-04 v1 计算机科学与博弈论
多智能体系统
综合经济学
经济学
摘要
许多以往对重复古诺博弈建模的尝试都假设需求是平稳的。这与现实世界场景不符,在现实中市场需求会因诸多原因在产品生命周期内演变。本文将重复古诺博弈建模为具有非平稳需求,使得企业/智能体面临各自独立的非平稳多臂老虎机问题实例。智能体可选择的臂/动作集合表示离散生产量;此处动作空间是有序的。智能体独立且自治,无法观测环境任何信息;它们仅在采取动作后看到自身奖励,且只致力于最大化这些奖励。我们提出一种新颖算法“带加权探索的自适应(AWE)-贪婪”,其远程基于著名的 -贪婪方法。该算法检测并量化因市场需求变化引起的奖励变化,并按需求变化程度成比例地调整学习率与探索率,从而使智能体能更好地识别新的最优动作。为高效探索,它还部署了一种利用有序动作空间对动作进行加权的机制。我们使用仿真研究市场中各种均衡的出现。此外,我们从系统中智能体总数与动作空间大小方面研究该方法的可扩展性。我们的模型中同时考虑了对称与非对称企业。我们发现,使用所提方法,智能体能依据需求变化迅速改变其行动方针,并且在许多仿真中表现出合谋行为。
引用
@article{arxiv.2201.00486,
title = {Using Non-Stationary Bandits for Learning in Repeated Cournot Games with Non-Stationary Demand},
author = {Kshitija Taywade and Brent Harrison and Judy Goldsmith},
journal= {arXiv preprint arXiv:2201.00486},
year = {2022}
}
备注
13 pages