利用潜在信息从视觉观察中进行对抗模仿学习
机器学习
2024-05-27 v3 系统与控制
系统与控制
机器学习
摘要
我们关注从视觉观察中进行模仿学习的问题,其中学习智能体仅以专家视频作为唯一学习来源。该框架的挑战包括缺乏专家动作以及环境的部分可观测性,因为真实状态只能从像素中推断。为应对此问题,我们首先对部分可观测环境中的模仿学习进行理论分析。我们建立了关于学习智能体次优性的上界,该上界相对于专家与智能体潜在状态转移分布之间的散度。受此分析启发,我们引入了一种称为潜在观察对抗模仿(Latent Adversarial Imitation from Observations)的算法,它将离策略对抗模仿技术与从观察序列中学习到的智能体状态潜在表示相结合。在高维连续机器人任务的实验中,我们表明我们在潜在空间中的无模型方法与最先进性能相匹配。此外,我们展示了如何利用专家视频提高从像素强化学习的效率。为确保可复现性,我们公开提供代码。
引用
@article{arxiv.2309.17371,
title = {Adversarial Imitation Learning from Visual Observations using Latent Information},
author = {Vittorio Giammarino and James Queeney and Ioannis Ch. Paschalidis},
journal= {arXiv preprint arXiv:2309.17371},
year = {2024}
}