混合能感知奖励塑形:面向策略优化的统一轻量级物理导向方法
机器学习
2026-03-17 v1 系统与控制
系统与控制
最优化与控制
摘要
深度强化学习在连续控制中表现出色,但通常需要大量探索;而基于物理的模型需要完整的方程且受 cubic complexity 的制约。本研究提出混合能感知奖励塑形 (H-EARS),将 potential-based reward shaping 与能感知 action regularization 统一。H-EARS 在约束 action 大小的同时,通过函数分解平衡任务特定和能源潜在值,实现 O(n) 的线性复杂度,通过捕获主导能量分量而无需完整动力学。我们建立了理论基础,包括:(1) 功能独立性以实现任务/能源的独立优化;(2) 能源导向的收敛加速;(3) 在函数近似下的收敛保证;以及 (4) approximate potential error bounds。分析了 Lyapunov 稳定性联系作为启发式指南。实验结果表明,在各基准测试中,H-EARS 在收敛性、稳定性和能源效率方面均取得改进。车辆仿真验证了在极端条件下的安全关键领域的适用性。结果确认,整合轻量级物理先验可提升模型无关 RL 的性能,无需完整系统模型,从而实现从实验室研究到工业应用的迁移。
引用
@article{arxiv.2603.11600,
title = {Hybrid Energy-Aware Reward Shaping: A Unified Lightweight Physics-Guided Methodology for Policy Optimization},
author = {Qijun Liao and Jue Yang and Yiting Kang and Xinxin Zhao and Yong Zhang and Mingan Zhao},
journal= {arXiv preprint arXiv:2603.11600},
year = {2026}
}
备注
17 pages, 27 figures