用于非平稳重复第一价拍卖的出价学习
机器学习
2025-10-07 v3 计算机科学与博弈论
信息论
math.IT
机器学习
摘要
第一价拍卖最近在数字广告市场中获得了显着的关注,例如谷歌从第二价拍卖转向第一价拍卖。与第二价拍卖不同,在第二价拍卖中,对私人估值的出价是支配策略,而在第一价拍卖中确定最优出价策略更为复杂。从学习角度来看,学习者(特定出价方)可以依次与环境(其他出价方,即对手)进行交互,以推断他们的行为。现有研究常常假设特定的环境条件并以最佳固定策略(静态基准)来衡量绩效。虽然这种方法确保了强大的学习保证,但在即使具有轻微非平稳性的环境中,静态基准可能与最优策略相距甚远。为此,一种动态基准——表示每个时间步骤可获得最高奖励的总和——提供了更合适的目标。然而,实现对动态基准的无懊怂学习需要额外的约束。通过检查在线第一价拍卖中的奖励函数,我们引入了两种指标来量化对手最高出价序列的规律性,这些指标作为非平稳性的度量。我们提供了针对满足这两种规律性约束之一的对手最高出价序列类的动态 regret 的 minimax 最优特征描述。我们的主要技术工具是带有新型乐观配置的乐观镜像下降(OMD)框架,这在此背景下实现 minimax 最优的动态 regret 速率方面非常合适。我们随后使用合成数据集来验证我们的理论保证,并演示我们的 метод 优于现有方法。
引用
@article{arxiv.2501.13358,
title = {Learning to Bid in Non-Stationary Repeated First-Price Auctions},
author = {Zihao Hu and Xiaoyu Fan and Yuan Yao and Jiheng Zhang and Zhengyuan Zhou},
journal= {arXiv preprint arXiv:2501.13358},
year = {2025}
}