中文

多阶段第二价格拍卖设计中的一种强化学习方法

机器学习 2026-03-04 v2 计算机科学与博弈论 机器学习

摘要

我们研究多阶段第二价格拍卖中的保留价优化,其中卖方的先前行动通过马尔可夫决策过程(MDP)影响竞标者后来的估值。与现有工作中的赌博机设置相比,我们的设置涉及三个挑战。首先,从卖方角度看,我们需要在可能存在旨在操纵卖方策略的不诚实竞标者的情况下高效探索环境。其次,我们希望在市场噪声分布未知时最小化卖方的收益后悔。第三,卖方每步收益是一个未知的、非线性的随机变量,甚至无法从环境直接观测而只能观测实现值。我们提出了一种应对全部三个挑战的机制。针对第一个挑战,我们结合一种称为“缓冲期”的新技术与低切换代价的强化学习(RL)思路,以限制不诚实竞标者的剩余收益,从而激励近似诚实竞标。第二个挑战通过一种新算法解决,该算法在市场噪声分布未知时无需纯探索。第三个挑战通过 LSVI-UCB 的扩展解决,我们利用拍卖的底层结构控制收益函数的不确定性。这三种技术最终形成 Contextual-LSVI-UCB-Buffer(CLUB)算法,当市场噪声已知时实现 Ō(H^{5/2}√K) 的收益后悔(其中 K 为回合数量,H 为每回合长度),当噪声未知且不对竞标者诚实性作假设时实现 Ō(H^3√K) 的收益后悔。

关键词

引用

@article{arxiv.2210.10278,
  title  = {A Reinforcement Learning Approach in Multi-Phase Second-Price Auction Design},
  author = {Rui Ai and Boxiang Lyu and Zhaoran Wang and Zhuoran Yang and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2210.10278},
  year   = {2026}
}