基于离线目标条件强化学习的图搜索 STL 规划框架:GraSP-STL
摘要
本文研究基于 Signal Temporal Logic (STL) 规范的离线、零样本规划。我们假设仅访问由 task-agnostic behavior policy 收集的 state-action-state 转换的离线数据集,无需 analytical dynamics model、无需进一步 environment interaction、无需 task-specific retraining。目标是合成产生满足任意未见 STL 规范的控制策略。为此,我们提出了 GraSP-STL—a 基于图搜索的离线 STL 规划框架。该方法从离线数据学习 goal-conditioned value function,并用于在 state space 上诱导 finite-horizon reachability metric。基于该 metric,它构建了一个有向图抽象,其节点表示 representative states,边编码可行的 short-horizon transitions。随后将规划表述为对 waypoint 序列的图搜索,使用 arithmetic-geometric mean robustness 及其 interval semantics 进行评估,并由 learned goal-conditioned policy 执行。该框架将可重用的 reachability learning 与 task-conditioned planning 分离,实现对未见 STL 任务和 long-horizon 规划的零样本 generalization,通过离线数据中 short-horizon behaviors 的 composition 实现。实验结果表明该方法在多种离线 STL 规划任务中有效。
引用
@article{arxiv.2603.29533,
title = {GraSP-STL: A Graph-Based Framework for Zero-Shot Signal Temporal Logic Planning via Offline Goal-Conditioned Reinforcement Learning},
author = {Ancheng Hou and Ruijia Liu and Xiang Yin},
journal= {arXiv preprint arXiv:2603.29533},
year = {2026}
}