从散度最小化视角理解后见之明目标重标记
机器学习
2023-01-31 v2 人工智能
摘要
后见之明目标重标记(hindsight goal relabeling)已成为多目标强化学习(RL)中的一项基础技术。其核心思想是:任何轨迹都可被视为到达其最终状态的次优演示。直观上,从这些任意演示中学习可视为一种模仿学习(IL)。然而,后见之明目标重标记与模仿学习之间的联系尚未被充分理解。本文提出一种新颖框架,从散度最小化视角理解后见之明目标重标记。将目标到达问题重新表述于IL框架中,不仅使我们能从第一性原理推导出若干现有方法,还为我们提供了来自IL的工具以改进目标到达算法。在实验中,我们发现,在后见之明重标记下,Q学习优于行为克隆(BC);然而,将二者直接朴素结合反而会损害性能。具体而言,我们观察到,仅当BC损失选择性地应用于根据Q函数使智能体更接近目标的动作时才有帮助。我们的框架还解释了如下令人困惑的现象:在目标到达中,(-1, 0)的奖励比(0, 1)的奖励带来显著更好的性能。
引用
@article{arxiv.2209.13046,
title = {Understanding Hindsight Goal Relabeling from a Divergence Minimization Perspective},
author = {Lunjun Zhang and Bradly C. Stadie},
journal= {arXiv preprint arXiv:2209.13046},
year = {2023}
}