基于虚拟知识库的可微推理
计算与语言
2020-02-26 v1 机器学习
摘要
我们考虑使用语料库作为虚拟知识库(KB)来回答复杂多跳问题的任务。特别地,我们描述了一个称为 DrKIT 的神经模块,它像 KB 一样遍历文本数据,软性地沿语料中实体提及间的关系路径进行跟随。每一步该模块结合稀疏矩阵 TFIDF 索引与对提及的上下文表示特殊索引的最大内积搜索(MIPS)。该模块可微,因此整个系统可使用基于梯度的方法从自然语言输入开始端到端训练。我们还描述了一种通过利用现有知识库生成难负例来对上下文表示编码器进行预训练的 scheme。我们展示 DrKIT 在 MetaQA 数据集的 3 跳问题上将准确率提高了 9 个点,将基于文本与基于 KB 的最先进水平之间的差距缩小了 70%。在 HotpotQA 上,DrKIT 相较基于 BERT 的重排序检索回答问题所需相关段落的方法带来了 10% 的提升。DrKIT 也非常高效,每秒处理的查询量是现有多跳系统的 10-100 倍。
引用
@article{arxiv.2002.10640,
title = {Differentiable Reasoning over a Virtual Knowledge Base},
author = {Bhuwan Dhingra and Manzil Zaheer and Vidhisha Balachandran and Graham Neubig and Ruslan Salakhutdinov and William W. Cohen},
journal= {arXiv preprint arXiv:2002.10640},
year = {2020}
}
备注
ICLR 2020