一种用于模仿学习的耦合流方法
机器学习
2023-05-02 v1 机器学习
摘要
在强化学习与模仿学习中,一个核心重要的对象是策略所诱导的状态分布。它在策略梯度定理中起着关键作用,并且关于它——以及相关的状态-动作分布——的引用可见于文献各处。尽管其重要,状态分布大多被间接且理论地讨论,而非被显式建模。原因在于缺乏适当的密度估计工具。本文中,我们研究基于归一化流(normalizing flow)的模型在上述分布中的应用。具体而言,我们利用通过 Kullback-Leibler(KL)散度的 Donsker-Varadhan 表示的最优性点相耦合的一对流,用于基于分布匹配的模仿学习。我们的算法 Coupled Flow Imitation Learning (CFIL) 在仅有单条专家轨迹的基准任务上取得了 state-of-the-art 性能,并自然扩展到多种其他设定,包括子采样与仅状态 regime。
引用
@article{arxiv.2305.00303,
title = {A Coupled Flow Approach to Imitation Learning},
author = {Gideon Freund and Elad Sarafian and Sarit Kraus},
journal= {arXiv preprint arXiv:2305.00303},
year = {2023}
}
备注
Accepted at ICML 2023