动态激励感知学习:情境拍卖中的鲁棒定价
机器学习
2020-02-27 v1 计算机科学与博弈论
机器学习
摘要
受广告交易平台中定价的启发,我们考虑在重复情境第二价格拍卖中针对策略买家的保留价格鲁棒学习问题。买家对物品的估值取决于描述物品的情境。然而,卖家并不知晓情境与买家估值之间的关系,即买家的偏好。卖家的目标是通过观测过往销售数据设计设定保留价格的学习策略,其目标是最小化收入遗憾值,其中遗憾值是相对于知晓买家异质偏好的全知策略计算的。给定卖家的目标,效用最大化的买家有激励不实出价以操纵卖家的学习策略。我们提出对这类策略行为鲁棒的学习策略。这些策略利用拍卖结果而非提交出价来估计偏好,同时控制每次拍卖结果对未来保留价格的长期影响。当卖家已知市场噪声分布时,我们提出称为情境鲁棒定价(CORP)的策略,实现T期遗憾值为 ,其中 为情境信息的维度。当卖家未知市场噪声分布时,我们提出两种遗憾值关于 为次线性的策略。
引用
@article{arxiv.2002.11137,
title = {Dynamic Incentive-aware Learning: Robust Pricing in Contextual Auctions},
author = {Negin Golrezaei and Adel Javanmard and Vahab Mirrokni},
journal= {arXiv preprint arXiv:2002.11137},
year = {2020}
}
备注
Accepted for publication in Operations Research Journal (An earlier version of this paper accepted to NeurIPS 2019.)