中文

通过全局预算平衡实现双边贸易中的无悔学习

计算机科学与博弈论 2024-09-04 v2 机器学习

摘要

双边贸易刻画了在两个理性主体——卖方与买方——之间进行中介的问题,二者均具有对所交易物品的私有估值。我们研究该问题的在线学习版本:在每个时间步,新的卖方与买方到达,学习者在对其(对抗性生成的)估值毫无了解的情况下必须为他们设定价格。在此设定下,已知的不可能性结果表明,当必须在每个时间步强制预算平衡时,不存在无悔算法。本文引入\emph{全局预算平衡}的概念,其仅要求学习者在整个时间范围内满足预算平衡。在这一自然松弛下,我们针对各种反馈模型给出了对抗性双边贸易的首个无悔算法。首先,我们证明在全反馈模型中,学习者可保证相对于事后最优固定价格的O~(T)\tilde O(\sqrt{T})后悔值,且该上界在多项对数因子意义下是最优的。其次,我们提供一种学习算法,在单比特反馈下保证O~(T3/4)\tilde O(T^{3/4})的后悔上界,并辅以一个Ω(T5/7)\Omega(T^{5/7})下界,该下界即使在两比特反馈模型中也成立。最后,我们引入并分析了一个替代基准,其被证明强于事后最优固定价格,且受带背包的bandit文献启发。

关键词

引用

@article{arxiv.2310.12370,
  title  = {No-Regret Learning in Bilateral Trade via Global Budget Balance},
  author = {Martino Bernasconi and Matteo Castiglioni and Andrea Celli and Federico Fusco},
  journal= {arXiv preprint arXiv:2310.12370},
  year   = {2024}
}

备注

Accepted at STOC 2024