中文

LobsDICE:基于稳态分布校正估计的观测离线学习

机器学习 2022-10-19 v2 人工智能

摘要

我们考虑观测学习(LfO)问题,其中智能体旨在仅根据专家的状态演示来模仿专家行为。我们进一步假设智能体无法与环境交互,但可访问由未知质量的某些智能体收集的动作标注转移数据。这种LfO的离线设定在许多真实场景中具有吸引力,其中真实专家动作不可获取且任意环境交互代价高昂或存在风险。本文提出LobsDICE,一种离线LfO算法,通过在稳态分布空间中优化来学习模仿专家策略。我们的算法求解单一凸最小化问题,其最小化由专家与智能体策略诱导的两个状态转移分布间的散度。通过一组广泛的离线LfO任务,我们展示了LobsDICE优于强基线方法。

关键词

引用

@article{arxiv.2202.13536,
  title  = {LobsDICE: Offline Learning from Observation via Stationary Distribution Correction Estimation},
  author = {Geon-Hyeong Kim and Jongmin Lee and Youngsoo Jang and Hongseok Yang and Kee-Eung Kim},
  journal= {arXiv preprint arXiv:2202.13536},
  year   = {2022}
}

备注

33 pages, Accepted at NeurIPS 2022