中文

通过动态确定性马尔可夫决策过程实现无遗憾的有状态发布定价

计算机科学与博弈论 2020-06-30 v2

摘要

本文在发布价格机制的范畴内,引入并研究了一个相当通用的在线问题,称为带容量约束的动态资源分配(DRACC)。该问题涵盖了有状态定价的多种应用,包括但不限于在线作业调度的发布价格以及动态二分图上的匹配。由于现有的在线学习技术无法为该问题产生无遗憾机制,我们开发了一个新颖的在线学习框架,该框架定义在具有动态状态转移和奖励函数的确定性马尔可夫决策过程之上。我们随后证明,如果该马尔可夫决策过程保证存在一个预言机,能够从任何初始状态以有界损失模拟任何给定策略——这一条件在DRACC问题中得到满足——那么该在线学习问题就可以以无遗憾的方式解决。我们的证明技术基于将其归约为带切换成本的在线学习,在该学习中,在线决策者每次从一个臂切换到另一个臂时都会产生额外成本。我们正式证明了这种联系,并进一步展示了DRACC如何应用于我们提出的有状态定价应用中。

关键词

引用

@article{arxiv.2005.01869,
  title  = {Stateful Posted Pricing with Vanishing Regret via Dynamic Deterministic Markov Decision Processes},
  author = {Yuval Emek and Ron Lavi and Rad Niazadeh and Yangguang Shi},
  journal= {arXiv preprint arXiv:2005.01869},
  year   = {2020}
}

备注

24 pages