中文

基于时空价值语义的稠密深度强化学习抽象化

机器学习 2024-05-28 v1 人工智能

摘要

智能混合物理系统(ICPS)是一种特殊类型的混合物理系统(CPS),融合了智能组件,尤其是卷积神经网络(CNN)和深度强化学习(DRL),用于执行感知、决策和控制等多方面任务。DRL用于决策可实现与环境的动态交互,生成旨在最大化累积奖励的控制动作。然而,由于操作环境的固有不确定性和ICPS的复杂性,DRL在学习阶段必须在复杂和动态的状态空间中进行探索。在决策过程中,DRL面临效率、泛化能力和数据稀缺等挑战。针对这些挑战,我们提出一种创新的抽象建模方法,基于空间时间价值语义,捕捉语义价值在时间和空间上分布变化。引入一种基于语义的抽象化,用于构建DRL学习过程的抽象马尔可夫决策过程(MDP)。此外,还阐述了针对抽象化的优化技术,旨在细化抽象模型,减缓抽象状态与具体状态之间的语义鸿沟。通过PRISM评估和分析抽象MDP模型的有效性。开展了一系列实验,包括车道保持、自适应巡航控制和交叉路口辅助等多样化场景,以演示我们抽象化方法的有效性。

关键词

引用

@article{arxiv.2405.15829,
  title  = {Spatio-temporal Value Semantics-based Abstraction for Dense Deep Reinforcement Learning},
  author = {Jihui Nie and Dehui Du and Jiangnan Zhao},
  journal= {arXiv preprint arXiv:2405.15829},
  year   = {2024}
}

备注

24 pages, 7 figures, conference