为执行任务的工人提供公平性:一种基于指标的 restless bandit 任务分配策略
人工智能
2026-02-26 v1 机器学习
多智能体系统
摘要
受机器维修、项目监控和防偷猎巡逻调度等应用启发,我们研究资源约束下随机过程的干预规划。该规划问题此前被建模为restless multi-armed bandits (RMAB),其中每个臂为依赖于干预的马尔可夫决策过程。然而,现有文献假设所有干预资源属于单一均匀池,限制了其在真实场景中的适用性,其中干预由一组工人执行,各工人具有不同的成本、预算和干预效果。本工作中,我们考虑一种新颖的RMAB设定,称为具有异质工人的多工人restless bandits (MWRMAB)。目标是规划干预调度,在最大化期望奖励的同时满足各工人的预算约束以及关于分配给各工人负载的公平性。我们的贡献有两点:(1) 提供Whittle指标的多元工人扩展以处理异质成本与每工人预算;(2) 开发一种基于指标的调度策略以实现公平性。此外,我们在多种成本结构下评估方法,表明所提方法在公平性上显著优于其他基线,且在累积奖励上损失不大。
引用
@article{arxiv.2303.00799,
title = {Fairness for Workers Who Pull the Arms: An Index Based Policy for Allocation of Restless Bandit Tasks},
author = {Arpita Biswas and Jackson A. Killian and Paula Rodriguez Diaz and Susobhan Ghosh and Milind Tambe},
journal= {arXiv preprint arXiv:2303.00799},
year = {2026}
}
备注
22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023), 10 pages