中文

非平稳设定下具有半赌博式反馈的在线第二价格拍卖

机器学习 2019-11-15 v1 数据结构与算法 计算机科学与博弈论 机器学习

摘要

本文研究非平稳在线第二价格拍卖问题。我们假设卖方通过第二价格拍卖在 TT 轮中出售同类物品,并且她可以在每轮设定保留价。在每轮中,投标者从卖方未知的联合分布中抽取其私有价值。随后,卖方公布该轮的保留价。接着,私有价值高于该轮公布保留价的投标者将其价值作为出价报告给卖方。出价最高且高于保留价的投标者赢得物品,并向卖方支付等于第二高出价或保留价(取二者中较大者)的价格。卖方希望在时间范围 TT 内最大化其总收益,同时随时间学习私有价值的分布。该问题比标准在线学习场景更具挑战性,因为私有价值分布是非平稳的,意味着投标者私有价值的分布可能随时间变化,并且我们需要使用非平稳后悔(\emph{non-stationary regret})来衡量算法的性能。据我们所知,本文首次从理论上学究重复拍卖在非平稳设定下的问题。我们的算法达到了非平稳后悔上界 O~(min{ST,Vˉ13T23})\tilde{\mathcal{O}}(\min\{\sqrt{\mathcal S T}, \bar{\mathcal{V}}^{\frac{1}{3}}T^{\frac{2}{3}}\}),其中 S\mathcal S 为分布切换次数,Vˉ\bar{\mathcal{V}} 为总变差之和,且算法无需知晓 S\mathcal SVˉ\bar{\mathcal{V}}。我们还证明了切换情形下的后悔下界 Ω(ST)\Omega(\sqrt{\mathcal S T}) 与动态情形下的 Ω(Vˉ13T23)\Omega(\bar{\mathcal{V}}^{\frac{1}{3}}T^{\frac{2}{3}}),表明我们的算法具有近乎最优的非平稳后悔。

关键词

引用

@article{arxiv.1911.05949,
  title  = {Online Second Price Auction with Semi-bandit Feedback Under the Non-Stationary Setting},
  author = {Haoyu Zhao and Wei Chen},
  journal= {arXiv preprint arXiv:1911.05949},
  year   = {2019}
}

备注

Accepted to AAAI-20