中文

学习状态相关的策略参数化用于带返工的动态技师路由

人工智能 2024-09-04 v1

摘要

家庭维修和安装服务需要技师上门为客户解决不同复杂度的任务。技师通常具有异构的技能和工作经验。客户的分布广泛,使得实现任务要求与技师技能之间的完美匹配不切实际。此外,技师经常因生病而缺勤。由于任务要求与技师技能之间的非完美匹配,一些任务可能无法解决,需要再次访问和返工。公司力求最小化因延误给客户带来的不便。我们将该问题建模为一个序贯决策过程,在多个服务日内,客户请求服务,而具有异构技能的技师被路由以服务系统中的客户。每天,我们的策略通过迭代地添加“重要”客户来构建路线。重要性基于分析考量,并以集成的方式衡量路由效率、服务紧急性和返工风险。我们通过强化学习提出这些因素的状态依赖平衡。一项综合研究表明,采取少量非完美匹配对整体服务质量相当有益。我们进一步证明了状态依赖参数化的价值。

关键词

引用

@article{arxiv.2409.01815,
  title  = {Learning State-Dependent Policy Parametrizations for Dynamic Technician Routing with Rework},
  author = {Jonas Stein and Florentin D Hildebrandt and Barrett W Thomas and Marlin W Ulmer},
  journal= {arXiv preprint arXiv:2409.01815},
  year   = {2024}
}