中文

通过原始Wasserstein状态占有率匹配的从观测离线模仿

机器学习 2024-06-11 v3 人工智能

摘要

在真实场景中,与环境的任意交互往往代价高昂,且专家演示的动作并非总可用。为减少对两者的需求,从观测的离线学习(LfO)被广泛研究:智能体仅给定专家状态和任务无关非专家状态-动作对来学习求解任务。最先进的分布校正估计(DICE)方法(如SMODICE所示)最小化学习器与经验专家策略间的状态占有率散度。然而,此类方法局限于 ff-散度(KL和 chi2chi^2)或带Rubinstein对偶的Wasserstein距离,后者约束了对基于Wasserstein解性能至关重要的底层距离度量。为启用更灵活的距离度量,我们提出原始Wasserstein DICE (PW-DICE)。它最小化学习器与专家状态占有率的原始Wasserstein距离,并利用对比学习的距离度量。理论上,我们的框架是SMODICE的推广,且是首个统一 ff-散度与Wasserstein最小化的工作。经验上,我们发现PW-DICE优于若干最先进方法。代码见 https://github.com/KaiYan289/PW-DICE。

关键词

引用

@article{arxiv.2311.01331,
  title  = {Offline Imitation from Observation via Primal Wasserstein State Occupancy Matching},
  author = {Kai Yan and Alexander G. Schwing and Yu-xiong Wang},
  journal= {arXiv preprint arXiv:2311.01331},
  year   = {2024}
}

备注

25 pages. Accepted to ICML 2024