重复拍卖中无后悔出价算法的收敛性分析
计算机科学与博弈论
2020-09-15 v1
摘要
博弈与无后悔算法之间的联系已在文献中被广泛研究。一个基本结果是,当所有参与者都采用无后悔策略时,会产生一个动作序列,其时间平均是该博弈的粗相关均衡。然而,在存在多个均衡的情况下,关于均衡选择所知甚少。在这项工作中,我们研究拍卖中无后悔出价算法的收敛性。除了理论意义外,拍卖中的出价动态从实践角度看也是一个重要问题。我们研究投标者之间的重复博弈,其中每时间步出售一件物品,且投标者的价值从未知分布中抽取。我们表明,如果投标者使用任何基于均值的(mean-based)学习规则,那么投标者将以高概率收敛到第二价格拍卖中的诚实纯纳什均衡、多槽位设置中VCG拍卖中的诚实纯纳什均衡,以及第一价格拍卖中的贝叶斯纳什均衡。我们注意到基于均值算法涵盖了多种已知的无后悔算法,如Exp3、UCB、-Greedy等。此外,我们分析此类学习算法产生的个体迭代的收敛性,而非序列的时间平均。我们的实验证实了我们的理论发现,并且在使用Deep Q-Learning等其他策略时也发现了类似的收敛性。
引用
@article{arxiv.2009.06136,
title = {Convergence Analysis of No-Regret Bidding Algorithms in Repeated Auctions},
author = {Zhe Feng and Guru Guruganesh and Christopher Liaw and Aranyak Mehta and Abhishek Sethi},
journal= {arXiv preprint arXiv:2009.06136},
year = {2020}
}