我现在该做什么?结合强化学习与符号规划
计算机视觉与模式识别
2019-01-08 v1
摘要
长期规划对许多强化学习算法而言是一大难题。在动态视觉环境中,该问题变得更加显著。在本工作中,我们提出层次化规划与强化学习(HIP-RL),一种将符号规划的优势与能力与深度强化学习的学习能力相融合的方法。我们将 HIPRL 应用于交互式问答与视觉语义规划等复杂视觉任务,并在三个具有挑战性的数据集上取得了最先进(SOTA)结果,同时在测试时步数更少、训练迭代次数更少。示例结果见 youtu.be/0TtWJ_0mPfI
引用
@article{arxiv.1901.01492,
title = {What Should I Do Now? Marrying Reinforcement Learning and Symbolic Planning},
author = {Daniel Gordon and Dieter Fox and Ali Farhadi},
journal= {arXiv preprint arXiv:1901.01492},
year = {2019}
}
备注
Currently under review