中文

利用反向强化学习习得回溯性知识

机器学习 2020-11-03 v3 人工智能

摘要

我们提出一种用于表示回溯性知识的反向强化学习(Reverse RL)方法。广义价值函数(GVFs)在表示预测性知识方面取得了巨大成功,即回答关于可能的未来结果的问题,例如“如果我们从 A 驾车到 B,预期会消耗多少燃油?”。然而,GVFs 无法回答诸如“已知一辆车在时刻 tt 位于 B,我们预期它有多少燃油?”这样的问题。要回答该问题,我们需要知道该车何时满油以及它如何到达 B。由于此类问题强调可能的过去事件对当下的影响,我们将它们的答案称为回溯性知识。本文中,我们展示了如何用反向 GVFs 表示回溯性知识,其通过反向 RL 训练。我们在表征学习和异常检测中实证展示了反向 GVFs 的效用。

关键词

引用

@article{arxiv.2007.06703,
  title  = {Learning Retrospective Knowledge with Reverse Reinforcement Learning},
  author = {Shangtong Zhang and Vivek Veeriah and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2007.06703},
  year   = {2020}
}

备注

NeurIPS 2020