利用反向强化学习习得回溯性知识
机器学习
2020-11-03 v3 人工智能
摘要
我们提出一种用于表示回溯性知识的反向强化学习(Reverse RL)方法。广义价值函数(GVFs)在表示预测性知识方面取得了巨大成功,即回答关于可能的未来结果的问题,例如“如果我们从 A 驾车到 B,预期会消耗多少燃油?”。然而,GVFs 无法回答诸如“已知一辆车在时刻 位于 B,我们预期它有多少燃油?”这样的问题。要回答该问题,我们需要知道该车何时满油以及它如何到达 B。由于此类问题强调可能的过去事件对当下的影响,我们将它们的答案称为回溯性知识。本文中,我们展示了如何用反向 GVFs 表示回溯性知识,其通过反向 RL 训练。我们在表征学习和异常检测中实证展示了反向 GVFs 的效用。
引用
@article{arxiv.2007.06703,
title = {Learning Retrospective Knowledge with Reverse Reinforcement Learning},
author = {Shangtong Zhang and Vivek Veeriah and Shimon Whiteson},
journal= {arXiv preprint arXiv:2007.06703},
year = {2020}
}
备注
NeurIPS 2020