中文

基于知识蒸馏的无模型DRL控制:从策略学习到实时实现

系统与控制 2026-03-10 v1 系统与控制

摘要

为解决深层强化学习(DRL)在电力逆变器中面临控制性能与计算负担之间的权衡所带来的部署难题,本文提出一种新型无模型控制框架,利用策略蒸馏。为处理模型无代理中固有的收敛不稳定性和稳态误差问题,本文构建了一种基于误差能量引导的混合奖励机制,以理论方式约束探索空间。具体而言,集成自适应重要加权机制于蒸馏架构中,以放大波动区域的重要性,确保通过缓解以稳态数据为主的观测偏差,从而实现瞬态控制逻辑的高质量迁移。该方法有效压缩重型DRL策略为轻量级神经网络,既保留所需控制性能,又克服部署时的计算瓶颈。本文通过硬件平台进行验证,该平台支持千瓦级实验。与传统方法的实验比较结果表明,所提技术将推理时间压缩至微秒级,并实现优异的瞬态响应速度和参数鲁棒性。

关键词

引用

@article{arxiv.2603.07964,
  title  = {Model-Free DRL Control for Power Inverters: From Policy Learning to Real-Time Implementation via Knowledge Distillation},
  author = {Yang Yang and Chenggang Cui and Xitong Niu and Jiaming Liu and Chuanlin Zhang},
  journal= {arXiv preprint arXiv:2603.07964},
  year   = {2026}
}

备注

10 pages, 6 figures, 8 tables, IEEE journal submission. This work proposes a model-free deep reinforcement learning control framework for voltage source inverters, integrating Lyapunov-based reward design and adaptive weighted policy distillation for lightweight real-time implementation, validated by simulation and kilowatt-level hardware experiments