基于变分反事实推理的离线模仿学习
机器学习
2024-01-01 v4
摘要
在离线模仿学习(IL)中,智能体旨在不借助额外在线环境交互的情况下学习最优专家行为策略。然而,在许多现实场景(如机器人操控)中,离线数据集由无奖励的次优行为收集而来。由于专家数据稀缺,智能体通常倾向于简单记忆劣质轨迹,且易受环境变化影响,缺乏泛化到新环境的能力。为自动生成高质量专家数据并提升智能体泛化能力,我们提出了一种通过反事实推理实现、名为离线模仿学习与反事实数据增强(OILCA)的框架。具体而言,我们利用可识别变分自编码器生成反事实样本以扩充专家数据。我们从理论上分析了所生成专家数据的影响及泛化能力的提升。此外,我们开展了大量实验,证明该方法在 DeepMind Control Suite 基准(分布内性能)和 CausalWorld 基准(分布外泛化)上均显著优于多种基线。我们的代码见 https://github.com/ZexuSun/OILCA-NeurIPS23。
引用
@article{arxiv.2310.04706,
title = {Offline Imitation Learning with Variational Counterfactual Reasoning},
author = {Bowei He and Zexu Sun and Jinxin Liu and Shuai Zhang and Xu Chen and Chen Ma},
journal= {arXiv preprint arXiv:2310.04706},
year = {2024}
}
备注
Published on NeurIPS2023