基于自助对比学习的观察模仿
人工智能
2023-02-14 v1 机器学习
多智能体系统
摘要
观察模仿(IfO)是一种学习范式,其通过在马尔可夫决策过程(MDP)中观察专家演示而不获取其动作来训练自主智能体。这些演示可以是环境状态的序列或环境的原始视觉观测。近期 IfO 的工作聚焦于低维环境状态观测下的该问题,然而在实践中获取这些高度特定的观测是不太可能的。本文采用一种更具挑战性但更现实的问题表述:学习在习得潜空间上操作、且仅能访问专家完成任务的视觉演示的控制策略。我们提出 BootIfOL,一种 IfO 算法,旨在学习一个奖励函数,该函数接收智能体轨迹并与专家进行比较,基于与智能体行为和隐式目标的相似性提供奖励。我们将该奖励函数视为智能体行为轨迹间的距离度量,并通过对比学习来学习它。对比学习目标旨在紧密表示专家轨迹,并将其与非专家轨迹拉开距离。对比学习中使用的非专家轨迹集合通过从利用当前奖励函数经 RL 学习的智能体滚动展开中进行自助而逐步变得更复杂。我们在多种控制任务上评估了我们的方法,表明我们可以使用有限数量的演示轨迹训练出有效策略,大幅改进了先前考虑原始观测的方法。
引用
@article{arxiv.2302.06540,
title = {Imitation from Observation With Bootstrapped Contrastive Learning},
author = {Medric Sonwa and Johanna Hansen and Eugene Belilovsky},
journal= {arXiv preprint arXiv:2302.06540},
year = {2023}
}