提升售后服务:基于深度强化学习的动态时间段分配问题
机器学习
2025-09-23 v1
摘要
问题定义:对于原始设备制造商(OEM),高端维护是售后服务中的战略组成部分,涉及客户与服务工程师之间的紧密协调。每个客户会建议几个他们维护任务的时间段,OEM 必须从中选择一个。这一决策需要及时完成,以支持客户的计划。每天结束时,计划为次日完成的任务安排的路线。我们在本文中研究了这种层次化和顺序决策问题——带承诺和客户偏好的动态时间段分配问题(DTSAP-CCP)。方法/结果:我们提出了两种不同的方法:1)基于注意力的深度强化学习与滚动执行(ADRL-RE),以及2)基于情景的规划方法(SBP)。ADRL-RE 将经过训练的注意力神经网络与滚动框架结合用于在线轨迹模拟。为支持训练,我们开发了一个神经启发式求解器,提供快速的路线规划解决方案,使其在复杂的组合设置下能够高效学习。SBP 方法通过抽取多个情景来指导时间段分配。数值实验表明,ADRL-RE 在性能上优于且 SBP 在稳定性上优于基于规则的方法和基于滚动的方法。此外,ADRL-RE 在大型医疗设备售后服务案例研究中证明了其强大的实际应用性。意义:本研究为 OEM 提供了实用的决策支持工具,用于动态维护时间表安排,在客户偏好和运营效率之间进行平衡。特别是,我们的 ADRL-RE 显示出强大的现实潜力,支持及时且以客户为导向的维护时间表安排。
引用
@article{arxiv.2509.17870,
title = {Improving After-sales Service: Deep Reinforcement Learning for Dynamic Time Slot Assignment with Commitments and Customer Preferences},
author = {Xiao Mao and Albert H. Schrotenboer and Guohua Wu and Willem van Jaarsveld},
journal= {arXiv preprint arXiv:2509.17870},
year = {2025}
}