中文

基于 Nash-集成多主体强化学习的激励对齐车间车辆能源交易

最优化与控制 2026-05-22 v1 人工智能 计算机科学与博弈论

摘要

车间车辆能源交易(V2V)使电动汽车(EV)能够实现去中心化的点对点能源交换,减少对电网的依赖并实现盈余容量的变现。然而,协调具有多样化充电需求和不确定到达-离开时间表的自感兴趣 EV 智能体仍具有挑战。现有方法要么需要计算受限的集中优化,要么缺乏公平性保证。本文将 Nash 议价解引入多主体深度确定性策略梯度(MADDPG),即 Nash-MADDPG,用于激励对齐的 V2V 能源交易。Nash 议价确定高效的双边定价,而 Nash 指导的价格接近奖励使智能体的学习趋向议价最优策略。30 天连续运行的评估显示,与 Double Auction 相比,社会福利提升 61.6%,交易量提升 62.9%,同时实现了优异的公平性,例如 Jain 指数提升 40.1%。在 6-100 个智能体跨 30 天时间范围内的测试确认了规模性在人口规模和经验上定价接近 Nash 议价基准。

关键词

引用

@article{arxiv.2605.22363,
  title  = {Incentive-Aligned Vehicle-to-Vehicle Energy Trading via Nash-Integrated Multi-Agent Reinforcement Learning},
  author = {Yujin Lin and Yue Yang and Hao Wang},
  journal= {arXiv preprint arXiv:2605.22363},
  year   = {2026}
}

备注

The 24th IEEE International Conference on Industrial Informatics, 2026