序贯阻塞匹配
计算机科学与博弈论
2022-03-24 v2
摘要
我们考虑一个序贯阻塞匹配(SBM)模型,其中策略性智能体反复向中央计划者报告对一组服务的序值偏好。计划者的目标是引出智能体的真实偏好并设计一个将服务匹配给智能体的策略,以最大化期望社会福利,并附加每个被匹配的服务在若干时间段内可被\emph{阻塞}或不可用的约束。自然地,SBM 建模了可复用服务向一组智能体的重复分配,其中每个被分配的服务在固定时长内变为不可用。我们首先考虑离线 SBM 设定,其中策略性智能体知晓其真实偏好。我们通过\emph{失真度}(distortion)来衡量任何策略的性能,即任何策略保证的最坏情况乘法近似。对于具有 个服务的设定,我们分别建立了任意确定性机制与随机机制的失真度下界 与 。我们通过提供基于随机串行独裁的、由\emph{激励比}(incentive ratio)度量的近似真实、确定性与随机策略来补充这些结果,它们与我们的下界相匹配。我们的结果表明,若考虑随机策略类,则有显著改进。最后,我们考虑具有 bandit 反馈的在线 SBM 设定,其中每个智能体最初不知晓其真实偏好,计划者必须通过在时间上匹配服务来帮助每个智能体学习其偏好。我们设计了一个基于探索后提交(Explore-then-Commit)范式的近似真实机制,其实现了对数动态近似后悔(regret)。
引用
@article{arxiv.2108.00073,
title = {Sequential Blocked Matching},
author = {Nicholas Bishop and Hau Chan and Debmalya Mandal and Long Tran-Thanh},
journal= {arXiv preprint arXiv:2108.00073},
year = {2022}
}
备注
AAAI-2022 Version