值迭代的图神经归纳
机器学习
2020-09-29 v1 人工智能
机器学习
摘要
许多强化学习任务可受益于基于环境内部模型的显式规划。此前,此类规划组件已通过部分对齐值迭代计算图的神经网络被引入。此类网络迄今聚焦于受限环境(如网格世界),且仅间接建模规划过程。我们放宽这些约束,提出一种图神经网络(GNN),其在任意环境模型上执行值迭代(VI)算法,并对 VI 的中间步骤进行直接监督。结果表明,GNN 能够准确建模值迭代,在多种分布外测试中恢复出有利的度量与策略。这表明,具有强监督的 GNN 执行器是深度强化学习系统中一个可行的组件。
引用
@article{arxiv.2009.12604,
title = {Graph neural induction of value iteration},
author = {Andreea Deac and Pierre-Luc Bacon and Jian Tang},
journal= {arXiv preprint arXiv:2009.12604},
year = {2020}
}
备注
ICML GRL+ 2020