基于深度强化学习的可交易信用方案日常动态 Tolling
机器学习
2025-04-14 v1 系统与控制
系统与控制
摘要
可交易信用方案(TCS)作为拥塞定价的替代方案,正受到越来越多的关注,因为其收入中性特征以及通过初始信用分配解决公平性问题的能力。对TCS进行建模以辅助未来的设计和实施,涉及用户与市场行为、需求-供给动态以及控制机制等方面的挑战。本文聚焦于后者,针对TCS情境下的日常动态 Tolling 问题展开研究,该问题被建模为离散时间马尔可夫决策过程,并使用强化学习(RL)算法求解。我们的结果表明,RL算法在旅行时间和社会福利方面,可与贝叶斯优化基准相当,并且在不同容量和需求水平下具有良好的推广能力。我们进一步评估了RL在不同超参数下的鲁棒性,并应用正则化技术来缓解动作振荡,从而生成可在日常需求和供给变化条件下迁移的实用 Tolling 策略。最后,我们讨论了诸如扩大到大规模网络等潜在挑战,并展示了如何利用迁移学习来提高计算效率并促进基于RL的TCS解决方案的实际部署。
引用
@article{arxiv.2504.08074,
title = {Deep Reinforcement Learning for Day-to-day Dynamic Tolling in Tradable Credit Schemes},
author = {Xiaoyi Wu and Ravi Seshadri and Filipe Rodrigues and Carlos Lima Azevedo},
journal= {arXiv preprint arXiv:2504.08074},
year = {2025}
}