中文

基于可学习时序抽象的情境规划

机器学习 2026-02-24 v1 人工智能

摘要

基于主义的强化学习用于连续控制存在两个实际瓶颈:主义时间尺度导致分支不可接受且时域过长;而现实环境常呈部分可观测性并出现态势迁移,这些迁移使驻点、完全可观测的动力学假设失效。我们引入 I-TAP(In-Context Latent Temporal-Abstraction Planner),一种离线强化学习框架,将情境适应与离散时序抽象空间中的在线规划统一于一个框架中。从离线轨迹中,I-TAP 学习一个观察条件下的残差量化变分自编码器,将每个观察-宏动作段压缩为从粗到细的离散残差 token 的层级结构,以及一个时序 Transformer 用于从短暂的近期历史序列自回归地预测这些 token 栈。 resulting sequence model 同时充当情境条件化的抽象动作先验和潜在动力学模型。在测试时期,I-TAP 在 token 空间中执行蒙特卡洛树搜索,使用短历史进行隐式适应而无需梯度更新,并将选定的 token 栈解码为可执行动作。 在确定性 MuJoCo、具有每回合潜在动力学态势的随机 MuJoCo 以及高维 Adroit 操控任务中,包括部分可观测变体,I-TAP 持续匹配或优于强模型自由和强模型基础的离线基线,展示了在随机动力学和部分可观测性下实现高效和稳健的情境规划。

关键词

引用

@article{arxiv.2602.18694,
  title  = {In-Context Planning with Latent Temporal Abstractions},
  author = {Baiting Luo and Yunuo Zhang and Nathaniel S. Keplinger and Samir Gupta and Abhishek Dubey and Ayan Mukhopadhyay},
  journal= {arXiv preprint arXiv:2602.18694},
  year   = {2026}
}