供应链博弈中的在线学习
计算机科学与博弈论
2022-07-12 v1 机器学习
摘要
我们研究供应商与零售商之间的重复博弈,二者希望在不全知问题参数的情况下最大化各自利润。在刻画具有完全信息的阶段博弈的 Stackelberg 均衡唯一性后,我们表明即使对需求和生产成本联合分布仅有部分知识,自然学习动态也保证供应商与零售商的联合策略轮廓收敛到阶段博弈的 Stackelberg 均衡。我们还证明了供应商后悔(regret)的有限时间界和零售商后悔的渐近界,其中具体速率取决于参与者预先可获知识的类型。在供应商非战略性(纵向一体化)的特殊情形下,当成本和需求被对抗性生成且需求被删失时,我们证明了零售商后悔(或等价地,社会福利)的最优有限时间后悔界。
引用
@article{arxiv.2207.04054,
title = {Online Learning in Supply-Chain Games},
author = {Nicolò Cesa-Bianchi and Tommaso Cesari and Takayuki Osogami and Marco Scarsini and Segev Wasserkrug},
journal= {arXiv preprint arXiv:2207.04054},
year = {2022}
}