中文

强化机制设计及其在赞助搜索拍卖动态定价中的应用

计算机科学与博弈论 2017-11-29 v1

摘要

在本研究中,我们应用强化学习技术并提出所谓的强化机制设计,以解决赞助搜索拍卖中的动态定价问题。与以往严重依赖投标者理性与共同知识的博弈论方法不同,我们采取数据驱动的方法,并试图在重复交互中学习任务保留价的最优集合。我们在某主要搜索引擎当前的赞助搜索框架内实现我们的方法:我们首先通过真实投标数据集训练一个买家行为模型,该模型能在给定投标者已知信息(包括搜索引擎披露的游戏参数以及投标者前几轮的 KPI 数据)的情况下准确预测出价。随后我们提出一种基于强化/MDP(马尔可夫决策过程)的算法,在类 GSP 拍卖中随时间优化保留价。我们的仿真表明,该框架优于包括当前在用方案在内的静态优化策略,以及若干其他动态策略。

关键词

引用

@article{arxiv.1711.10279,
  title  = {Reinforcement Mechanism Design, with Applications to Dynamic Pricing in Sponsored Search Auctions},
  author = {Weiran Shen and Binghui Peng and Hanpeng Liu and Michael Zhang and Ruohan Qian and Yan Hong and Zhi Guo and Zongyao Ding and Pengjun Lu and Pingzhong Tang},
  journal= {arXiv preprint arXiv:1711.10279},
  year   = {2017}
}