中文

基于松弛分布匹配的带次优演示离线模仿学习

机器学习 2023-03-07 v1

摘要

离线模仿学习(IL)有望从预收集的演示中习得高性能策略,而无需与环境交互。然而,完全离线地模仿行为通常需要大量专家数据。为应对此问题,我们研究这样一种设定:我们拥有有限的专家数据与补充的次优数据。此情形下,一个已知问题是所学策略与收集离线数据的行为策略之间的分布偏移。先前工作通过正则化学得策略与行为策略的平稳状态-动作分布间的 KL 散度来缓解该问题。我们认为,此类基于精确分布匹配的约束可能过度保守并妨碍策略学习,尤其在非完美离线数据高度次优时。为解决此问题,我们提出 RelaxDICE,其采用非对称松弛的 f-散度进行显式支撑正则化。具体而言,我们并不驱动所学策略精确匹配行为策略,而是当其平稳状态-动作分布间密度比以上界为常数时施加极小惩罚。注意该表述导致一个嵌套极小-极大优化问题,这在实践中引发不稳定性。RelaxDICE 通过为内部极大化问题提供闭式解来应对此挑战。大量实证研究表明,在 22 个非完美数据集高度次优的设定中,我们的方法在六个标准连续控制环境中平均超过 30% 性能增益,显著优于最佳先前离线 IL 方法。

关键词

引用

@article{arxiv.2303.02569,
  title  = {Offline Imitation Learning with Suboptimal Demonstrations via Relaxed Distribution Matching},
  author = {Lantao Yu and Tianhe Yu and Jiaming Song and Willie Neiswanger and Stefano Ermon},
  journal= {arXiv preprint arXiv:2303.02569},
  year   = {2023}
}

备注

AAAI 2023