中文

通过离线预训练 State-to-Go Transformer 从视觉观测中学习

机器学习 2023-06-23 v1 计算机视觉与模式识别

摘要

从视觉观测中学习(LfVO)旨在仅从视觉观测数据中恢复策略,是一个有前景但具挑战性的问题。现有的 LfVO 方法要么仅采用低效的在线学习方案,要么需要诸如目标状态等额外的任务特定信息,使其不适用于开放式任务。为解决这些问题,我们提出一种从视觉观测学习的两阶段框架。在第一阶段,我们引入并离线预训练 State-to-Go(STG)Transformer 以预测并区分演示的潜在转移。随后,在第二阶段,STG Transformer 为下游强化学习任务提供内在奖励,其中智能体仅从内在奖励中学习。在 Atari 和 Minecraft 上的实证结果表明,我们提出的方法优于基线,且在部分任务中甚至达到与从环境奖励学习的策略相当的性能。这些结果揭示了利用仅含视频的数据来解决困难视觉强化学习任务、而非依赖包含状态、动作与奖励的完整离线数据集的潜力。项目网站与代码见 https://sites.google.com/view/stgtransformer。

关键词

引用

@article{arxiv.2306.12860,
  title  = {Learning from Visual Observation via Offline Pretrained State-to-Go Transformer},
  author = {Bohan Zhou and Ke Li and Jiechuan Jiang and Zongqing Lu},
  journal= {arXiv preprint arXiv:2306.12860},
  year   = {2023}
}

备注

19 pages