中文

保持每个人快乐:众多物品在少量副本下的在线公平分配

机器学习 2025-05-30 v2 人工智能 机器学习

摘要

本文考虑的是一种新型的在线公平分配问题,涉及多个代理人。学习者依次观察到一个不可分割的物品,必须在满足公平性和效率约束的前提下,将其不可撤销地分配给代理人之一。现有算法假设物品数量较少且副本数充足,这确保了从噪声 bandit 反馈中能获得所有物品-代理人对的良好效用估计。然而,这一假设在许多现实场景中并不成立,例如在线平台拥有大量用户(物品),这些用户仅使用平台的服务提供商(代理人)少数几次(物品的少量副本),这使得难以准确估计所有物品-代理人对的效用。为此,我们假设效用是物品-特征与代理人特征函数的未知函数。我们提出了将在线公平分配建模为情境 bandit问题的算法,并给出亚线性 regret 保证。我们的实验结果进一步验证了所提算法的有效性。

关键词

引用

@article{arxiv.2408.12845,
  title  = {Keep Everyone Happy: Online Fair Division of Numerous Items with Few Copies},
  author = {Arun Verma and Indrajit Saha and Makoto Yokoo and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2408.12845},
  year   = {2025}
}

备注

We propose a contextual bandit algorithm for online fair division problems involving multiple agents and a large number of items, each with only a few copies