电动汽车的个性化动态定价策略:强化学习方法
系统与控制
2024-01-02 v1 计算机科学与博弈论
系统与控制
摘要
随着快速电动汽车充电站数量的增加和信息技术的普及,快速充电站之间的电价竞争备受期待,其中公共和/或隐私保护信息的利用将发挥关键作用。另一方面,利己的电动汽车(EV)用户试图根据电价、估计的等待时间及其荷电状态,选择快速充电站进行充电,以最大化其效用。虽然现有研究主要集中在寻找均衡价格上,但本研究提出了一种个性化动态定价策略,利用强化学习(RL)方法使快速充电站的收益最大化。我们首先提出了一个多快速充电站竞争仿真环境,利用基于博弈的充电站选择模型和货币效用函数来建模 EV 用户的自私行为。在该环境中,我们提出了一种基于 Q-learning 的 PeDP,以最大化快速充电站的收益。通过基于该环境的数值模拟:(1)通过将经典 Bertrand 竞争模型与所提出的快速充电站 PeDP 进行比较(从系统角度),我们确定了等待时间在 EV 充电市场中的重要性;(2)我们评估了所提出 PeDP 的性能,并分析了信息对该策略的影响(从服务提供商角度);(3)可以看出,在 EV 充电市场的特定情况下,隐私保护信息共享可能会被基于人工智能的 PeDP 滥用(从客户角度)。
引用
@article{arxiv.2401.00661,
title = {Personalized Dynamic Pricing Policy for Electric Vehicles: Reinforcement learning approach},
author = {Sangjun Bae and Balazs Kulcsar and Sebastien Gros},
journal= {arXiv preprint arXiv:2401.00661},
year = {2024}
}