基于逻辑信息的强化学习用于大规模混合系统的跨域优化
机器学习
2025-11-04 v1 人工智能
摘要
混合系统(CPS)要求在严格的安全逻辑约束下联合优化离散网络行为和连续物理参数。然而,现有层次方法往往牺牲全局最优性,而基于强化学习的混合动作空间方法常依赖脆弱的奖励惩罚、掩码或屏障措施,难以保证约束满足。我们提出逻辑信息强化学习(LIRL),为标准策略梯度算法配备投影,将低维潜在动作映射到由一阶逻辑在线定义的可接受混合流形上,这保证了每一步探索的可行性,无需调参。我们在多个场景下进行了实验评估,包括工业制造、电动汽车充电站和交通信号控制,在所有情况下,我们的方法均优于现有的层次优化方法。以工业制造中的一个机器人减速器装配系统为例,LIRL 在组合makespan-能耗目标上实现了最多36.47%至44.33%的降低。同时,它始终保持零约束违规,显著超越了最先进的混合动作强化学习基线。得益于其声明性逻辑基于约束的表述,此框架可无缝迁移到其他领域,如智能交通和智能电网,从而为大规模CPS的安全实时优化铺平了道路。
引用
@article{arxiv.2511.00806,
title = {Logic-informed reinforcement learning for cross-domain optimization of large-scale cyber-physical systems},
author = {Guangxi Wan and Peng Zeng and Xiaoting Dong and Chunhe Song and Shijie Cui and Dong Li and Qingwei Dong and Yiyang Liu and Hongfei Bai},
journal= {arXiv preprint arXiv:2511.00806},
year = {2025}
}