基于信号时序逻辑的强化学习分层方法
机器学习
2026-04-07 v1 计算机科学中的逻辑
系统与控制
系统与控制
代数拓扑
摘要
在本文中,我们发展了信号时序逻辑(STL)的分层语义,其中每个原子谓词被解释为分层空间中的成员测试。这一视角揭示了分层理论与 STL 之间的新颖对应原理,表明大多数 STL 公式可被视为诱导时空的分层。该解释的意义 twofold。首先,它为分析深度强化学习(DRL)生成的嵌入空间结构提供了一个新的理论框架,并将其与周围决策空间的几何联系起来。其次,它提供了一个原则性框架,既能复用现有高维分析工具,又能激发新型计算技术的创建。为夯实理论,我们(1)展示了分层理论在 Minigrid 游戏中的作用,(2)将数值技术应用于玩此类游戏的 DRL 智能体的潜在嵌入,其中 STL 公式的鲁棒性被用作奖励。在此过程中,我们提出了计算高效的签名,根据初步证据,这些签名在揭示此类嵌入空间的分层结构方面表现出前景。
引用
@article{arxiv.2604.04923,
title = {Stratifying Reinforcement Learning with Signal Temporal Logic},
author = {Justin Curry and Alberto Speranzon},
journal= {arXiv preprint arXiv:2604.04923},
year = {2026}
}
备注
8 pages, 13 figures