基于 Nash-集成多主体强化学习的激励对齐车间车辆能源交易
最优化与控制
2026-05-22 v1 人工智能
计算机科学与博弈论
摘要
车间车辆能源交易(V2V)使电动汽车(EV)能够实现去中心化的点对点能源交换,减少对电网的依赖并实现盈余容量的变现。然而,协调具有多样化充电需求和不确定到达-离开时间表的自感兴趣 EV 智能体仍具有挑战。现有方法要么需要计算受限的集中优化,要么缺乏公平性保证。本文将 Nash 议价解引入多主体深度确定性策略梯度(MADDPG),即 Nash-MADDPG,用于激励对齐的 V2V 能源交易。Nash 议价确定高效的双边定价,而 Nash 指导的价格接近奖励使智能体的学习趋向议价最优策略。30 天连续运行的评估显示,与 Double Auction 相比,社会福利提升 61.6%,交易量提升 62.9%,同时实现了优异的公平性,例如 Jain 指数提升 40.1%。在 6-100 个智能体跨 30 天时间范围内的测试确认了规模性在人口规模和经验上定价接近 Nash 议价基准。
引用
@article{arxiv.2605.22363,
title = {Incentive-Aligned Vehicle-to-Vehicle Energy Trading via Nash-Integrated Multi-Agent Reinforcement Learning},
author = {Yujin Lin and Yue Yang and Hao Wang},
journal= {arXiv preprint arXiv:2605.22363},
year = {2026}
}
备注
The 24th IEEE International Conference on Industrial Informatics, 2026