中文

面向基础策略多阶段规划的命中时间同构

机器学习 2026-05-08 v1

摘要

我们提出了一种用于离线强化学习的全新算子理论表示学习框架,该框架从命中时间观测中恢复受控马尔可夫过程的有向时间几何。虽然现有方法通常产生对称距离或无法满足三角不等式,但我们的框架学习了一种 Hilbert 空间位移几何,其中期望命中时间被实现为潜在位移的线性泛函。我们证明该表示在潜在线性闭包下存在,且在相差一个有界线性同构的意义下是唯一可辨识的。对于有限维实现,我们证明了全局命中时间误差受限于被环境瞬态谱半径放大的一步转移误差。此外,我们提供了考虑近似、统计复杂度和轨迹标签不匹配的有限样本保证。基于该理论,我们设计了同构嵌入学习(IEL)作为一种与目标无关的基础策略学习算法,该算法通过显式的命中时间回归来锚定 HILP 式的一致性目标,以确保学习到的几何反映实际的决策时间进展。这种非对称且可组合的结构使得针对长视界导航的基于图的鲁棒多阶段规划成为可能。实验表明,IEL 提升了从离线迷宫运动数据中学习基础策略的现有技术水平。我们的代码可在 https://github.com/MagnusBoock/IEL 找到。

关键词

引用

@article{arxiv.2605.06470,
  title  = {Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies},
  author = {Magnus Victor Boock and Abdullah Akgül and Mustafa Mert Çelikok and Melih Kandemir},
  journal= {arXiv preprint arXiv:2605.06470},
  year   = {2026}
}