中文

基于强化学习的呼叫中心优化:价值迭代与近端策略优化的比较

人工智能 2025-07-25 v1

摘要

本文探讨了应用强化学习(Reinforcement Learning, RL)来优化呼叫中心的呼叫路由,以最小化客户等待时间和员工闲置时间。两种方法进行比较:一种是基于已知系统动力学下的价值迭代(Value Iteration, VI)的模型方法,另一种是基于经验学习的近端策略优化(Proximal Policy Optimisation, PPO)的无模型方法。对于模型方法,采用理论模型;而对于无模型方法,开发了结合离散事件仿真(Discrete Event Simulation, DES)与OpenAI Gym环境的仿真模型。两种模型将问题在技能路由(Skills-Based Routing, SBR)框架下建立为马尔可夫决策过程(Markov Decision Process, MDP),假设客户到达服从泊松分布,服务时间和放弃时间服从指数分布。对于策略评估,评估了随机策略、VI策略和PPO策略。经过1000次测试 episode后,PPO始终实现最高的奖励值,同时实现最低的客户等待时间和员工闲置时间,尽管其训练时间较长。

关键词

引用

@article{arxiv.2507.18398,
  title  = {Optimising Call Centre Operations using Reinforcement Learning: Value Iteration versus Proximal Policy Optimisation},
  author = {Kwong Ho Li and Wathsala Karunarathne},
  journal= {arXiv preprint arXiv:2507.18398},
  year   = {2025}
}

备注

10 pages