一般动态匹配系统中的奖励最大化
概率论
2018-04-24 v4 最优化与控制
摘要
我们考虑一个具有不同类型物品随机到达的匹配系统。物品在队列中等待——每种物品类型一个队列——直到它们被“匹配”。每次匹配需要不同种类物品的一定数量;在匹配被激活后,相关联的物品离开系统。存在一组有限的 Possible matchings(可能匹配),每个产生一定数量的“奖励”。该模型有广泛应用,包括按订单装配系统、互联网广告、匹配门户网站等。我们提出了一种最优匹配方案,它在保持队列稳定的同时渐近最大化长期平均匹配奖励。该方案在一个特殊构造的虚拟系统中进行匹配决策,进而控制物理系统中的决策。虚拟系统的关键特征是,与物理系统不同,它允许队列变为负值。虚拟系统中的匹配由贪婪原始对偶(greedy primal-dual, GPD)算法的扩展版本控制,我们证明该算法是渐近最优的——这进而意味着整个方案的渐近最优性。该方案是实时的,在任何时刻它使用基于虚拟和物理队列当前状态的简单规则。它非常鲁棒,因为它不需要任何物品到达率的知识,并自动适应变化的比率。扩展的 GPD 算法及其渐近最优性适用于相当一般的排队网络框架,不限于匹配问题,因此具有独立意义。
引用
@article{arxiv.1608.01646,
title = {Reward Maximization in General Dynamic Matching Systems},
author = {Mohammadreza Nazari and Alexander L. Stolyar},
journal= {arXiv preprint arXiv:1608.01646},
year = {2018}
}
备注
Revision