中文

基于奖励塑形的多跳知识图谱推理

人工智能 2018-09-13 v2 计算与语言 机器学习

摘要

多跳推理是不完整知识图谱(KG)上查询回答(QA)的一种有效方法。该问题可被表述为一个强化学习(RL)设定,其中基于策略的智能体依次扩展其推理路径直至到达目标。然而,在不完整的 KG 环境中,智能体接收到的奖励质量较低,受到训练数据中假阴性的污染,这损害了测试时的泛化能力。此外,由于训练未使用黄金动作序列,智能体可能被偶然导向正确答案的伪搜索轨迹所误导。我们提出两项建模改进以解决这两个问题:(1)我们采用预训练的单跳嵌入模型来估计未观测事实的奖励,从而减小假阴性监督的影响;(2)我们通过使用随机生成的边掩码迫使智能体探索多样化路径集合,来对抗同策略 RL 对伪路径的敏感性。我们的方法在多个基准数据集上显著优于现有的基于路径的 KGQA 模型,并且可与基于嵌入的模型相媲美或更好。

关键词

引用

@article{arxiv.1808.10568,
  title  = {Multi-Hop Knowledge Graph Reasoning with Reward Shaping},
  author = {Xi Victoria Lin and Richard Socher and Caiming Xiong},
  journal= {arXiv preprint arXiv:1808.10568},
  year   = {2018}
}

备注

Accepted to EMNLP 2018, 12 pages