通过离线预训练 State-to-Go Transformer 从视觉观测中学习
机器学习
2023-06-23 v1 计算机视觉与模式识别
摘要
从视觉观测中学习(LfVO)旨在仅从视觉观测数据中恢复策略,是一个有前景但具挑战性的问题。现有的 LfVO 方法要么仅采用低效的在线学习方案,要么需要诸如目标状态等额外的任务特定信息,使其不适用于开放式任务。为解决这些问题,我们提出一种从视觉观测学习的两阶段框架。在第一阶段,我们引入并离线预训练 State-to-Go(STG)Transformer 以预测并区分演示的潜在转移。随后,在第二阶段,STG Transformer 为下游强化学习任务提供内在奖励,其中智能体仅从内在奖励中学习。在 Atari 和 Minecraft 上的实证结果表明,我们提出的方法优于基线,且在部分任务中甚至达到与从环境奖励学习的策略相当的性能。这些结果揭示了利用仅含视频的数据来解决困难视觉强化学习任务、而非依赖包含状态、动作与奖励的完整离线数据集的潜力。项目网站与代码见 https://sites.google.com/view/stgtransformer。
引用
@article{arxiv.2306.12860,
title = {Learning from Visual Observation via Offline Pretrained State-to-Go Transformer},
author = {Bohan Zhou and Ke Li and Jiechuan Jiang and Zongqing Lu},
journal= {arXiv preprint arXiv:2306.12860},
year = {2023}
}
备注
19 pages