LobsDICE:基于稳态分布校正估计的观测离线学习
机器学习
2022-10-19 v2 人工智能
摘要
我们考虑观测学习(LfO)问题,其中智能体旨在仅根据专家的状态演示来模仿专家行为。我们进一步假设智能体无法与环境交互,但可访问由未知质量的某些智能体收集的动作标注转移数据。这种LfO的离线设定在许多真实场景中具有吸引力,其中真实专家动作不可获取且任意环境交互代价高昂或存在风险。本文提出LobsDICE,一种离线LfO算法,通过在稳态分布空间中优化来学习模仿专家策略。我们的算法求解单一凸最小化问题,其最小化由专家与智能体策略诱导的两个状态转移分布间的散度。通过一组广泛的离线LfO任务,我们展示了LobsDICE优于强基线方法。
引用
@article{arxiv.2202.13536,
title = {LobsDICE: Offline Learning from Observation via Stationary Distribution Correction Estimation},
author = {Geon-Hyeong Kim and Jongmin Lee and Youngsoo Jang and Hongseok Yang and Kee-Eung Kim},
journal= {arXiv preprint arXiv:2202.13536},
year = {2022}
}
备注
33 pages, Accepted at NeurIPS 2022