利用多智能体强化学习实现高速铁路动态定价
机器学习
2025-10-01 v2 人工智能
多智能体系统
摘要
本文针对高速客运铁路行业的一个关键挑战:在竞争与合作并存的运营商环境中设计有效的动态定价策略。为此,我们提出了一种基于非零和马尔可夫博弈的多智能体强化学习(MARL)框架,结合随机效用模型来捕捉乘客决策过程。与能源、航空和移动网络等领域的先前研究不同,利用深度强化学习进行铁路系统动态定价的研究关注有限。本研究的一个关键贡献是 RailPricing-RL——一个参数化且通用的强化学习模拟器,用于建模多种铁路网络配置和需求模式,同时支持对用户行为的真实微观建模。该环境支撑所提出的 MARL 框架,该框架对异质智能体进行建模,使其在追求个体利润最大化的同时促进合作行为以同步衔接服务。实验结果验证了该框架,展示了用户偏好如何影响 MARL 性能以及定价策略如何影响乘客选择、效用和整体系统动态。本研究为推进铁路系统中的动态定价策略奠定了基础,将盈利能力与系统级效率相协调,并支持未来关于优化定价策略的研究。
引用
@article{arxiv.2501.08234,
title = {Dynamic Pricing in High-Speed Railways Using Multi-Agent Reinforcement Learning},
author = {Enrique Adrian Villarrubia-Martin and Luis Rodriguez-Benitez and David Muñoz-Valero and Giovanni Montana and Luis Jimenez-Linares},
journal= {arXiv preprint arXiv:2501.08234},
year = {2025}
}
备注
39 pages, 5 figures