M-Walk:基于蒙特卡洛树搜索的图上游走学习
人工智能
2018-12-19 v5 计算与语言
机器学习
摘要
对于给定的查询与源节点,学习在图上朝目标节点游走是知识库补全(KBC)等应用中的重要问题。它可表述为具有已知状态转移模型的强化学习(RL)问题。为克服稀疏奖励的挑战,我们开发了称为M-Walk的图游走智能体,由深度循环神经网络(RNN)与蒙特卡洛树搜索(MCTS)组成。RNN编码状态(即游走路径的历史)并分别映射到策略与Q值。为从稀疏奖励中有效训练智能体,我们将MCTS与神经策略结合以生成带来更多正奖励的轨迹。从这些轨迹中,网络以离策略方式使用Q-learning改进,其通过参数共享修改RNN策略。我们提出的RL算法重复应用此策略改进步骤来学习模型。测试时,MCTS与神经策略结合预测目标节点。在多个图游走基准上的实验结果显示,M-Walk能比其它主要基于策略梯度的RL方法学到更好的策略,也优于传统KBC基线。
引用
@article{arxiv.1802.04394,
title = {M-Walk: Learning to Walk over Graphs using Monte Carlo Tree Search},
author = {Yelong Shen and Jianshu Chen and Po-Sen Huang and Yuqing Guo and Jianfeng Gao},
journal= {arXiv preprint arXiv:1802.04394},
year = {2018}
}
备注
Yelong Shen, Jianshu Chen and Po-Sen Huang contributed equally to the paper. Published at 32nd Conference on Neural Information Processing Systems (NeurIPS 2018), Montr\'eal, Canada