通过原始Wasserstein状态占有率匹配的从观测离线模仿
机器学习
2024-06-11 v3 人工智能
摘要
在真实场景中,与环境的任意交互往往代价高昂,且专家演示的动作并非总可用。为减少对两者的需求,从观测的离线学习(LfO)被广泛研究:智能体仅给定专家状态和任务无关非专家状态-动作对来学习求解任务。最先进的分布校正估计(DICE)方法(如SMODICE所示)最小化学习器与经验专家策略间的状态占有率散度。然而,此类方法局限于 -散度(KL和 )或带Rubinstein对偶的Wasserstein距离,后者约束了对基于Wasserstein解性能至关重要的底层距离度量。为启用更灵活的距离度量,我们提出原始Wasserstein DICE (PW-DICE)。它最小化学习器与专家状态占有率的原始Wasserstein距离,并利用对比学习的距离度量。理论上,我们的框架是SMODICE的推广,且是首个统一 -散度与Wasserstein最小化的工作。经验上,我们发现PW-DICE优于若干最先进方法。代码见 https://github.com/KaiYan289/PW-DICE。
引用
@article{arxiv.2311.01331,
title = {Offline Imitation from Observation via Primal Wasserstein State Occupancy Matching},
author = {Kai Yan and Alexander G. Schwing and Yu-xiong Wang},
journal= {arXiv preprint arXiv:2311.01331},
year = {2024}
}
备注
25 pages. Accepted to ICML 2024