面向时间约束限制的无约束多臂老虎机:优化城市服务分配
机器学习
2025-11-18 v2 人工智能
计算工程、金融与科学
计算机与社会
摘要
市政检查是维持商品和服务质量的重要手段。本文以芝加哥食品机构检查为案例,探讨如何智能地安排服务检查以最大化其影响。芝加哥公共卫生部 (CDPH) 每年检查数千家机构,失败率很高(2023 年超过 3000 项失败检查报告)。为平衡确保遵守指南、最小化对机构的 disruption 以及最小化检查成本的目标,CDPH 为每个机构分配一个检查窗口,并保证在该窗口内对其进行一次且仅一次的检查。同时,CDPH 也承诺对意外食品安全紧急情况或投诉进行突如其来的公共卫生检查。这些约束为一种无约束多臂老虎机 (RMAB) 方法带来了挑战,而现有方法尚未解决。我们发展了一种针对 RMAB 的 Whittle 指数系统的扩展,能够保证动作窗口约束和频率,并且可以用于优化动作窗口的分配。我们简要地将 MDP 重构与基于整数规划的前瞻相结合,以在满足约束条件的前提下最大化检查的影响。开发了一个基于神经网络的监督学习模型,用于预测真实芝加哥机构的状态转移,基于公开的 CDPH 检查记录,显示其比直接预测机构失败率提升了 10% 的 AUC。我们的实验不仅在仿真中实现了最高可达 24% 或在真实数据上可达 33% 的目标性提升,显示其对突发检查具有鲁棒性,还能洞察排程约束的影响。
引用
@article{arxiv.2502.00045,
title = {Optimizing Urban Service Allocation with Time-Constrained Restless Bandits},
author = {Yi Mao and Andrew Perrault},
journal= {arXiv preprint arXiv:2502.00045},
year = {2025}
}