基于深度强化学习的需求响应计划决策策略:考虑用户满意度反馈
系统与控制
2025-09-04 v1 系统与控制
摘要
需求响应提供商(DRP)是上层配电系统操作员与需求响应(DR)计划中下层参与者之间的中介。通常情况下,DRP 充当领导者,确定电价策略以实现经济收益最大化,而终端用户则根据电价信号调整其功耗。然而,这种以利润为导向的双层优化模型往往忽略了终端用户参与 DR 计划的满意度。此外,用户决策策略和满意度评估机制的详细数学模型通常对 DRP 来说是不可获得的,这给传统基于模型的求解方法带来了重大挑战。为此,本文设计了用户侧满意度评估机制,并提出了一种多分支时序融合双延迟深度确定性策略梯度算法(MBTF-TD3)。通过动态调整惩罚项将用户满意度反馈纳入奖励函数中。该提议的 MBTF 结构有效提取了时间序列观测数据中的时序特征依赖,而动态调整的惩罚函数成功地提高了用户整体满意度水平。本文进行了多项实验,以验证所提出解决方案算法的性能和有效性。
引用
@article{arxiv.2509.02946,
title = {Deep Reinforcement Learning-Based Decision-Making Strategy Considering User Satisfaction Feedback in Demand Response Program},
author = {Xin Li and Li Ding and Qiao Lin and Zhen-Wei Yu},
journal= {arXiv preprint arXiv:2509.02946},
year = {2025}
}
备注
This version corrects equation display errors that occurred in the IEEE Xplore version. Please cite the official IEEE DOI:10.1109/ICPST65050.2025.11089098