超越数据集的学习:知识图谱增强的神经网络用于自然语言处理
计算与语言
2018-05-22 v2
摘要
机器学习一直是许多AI问题的典型解决方案,但学习仍严重依赖于特定的训练数据。某些学习模型可在贝叶斯框架下融入先验知识,但这些模型无法按需访问任何有组织的世界知识。本工作中,我们提出以知识图谱(KG)事实三元组的形式为世界知识增强NLP任务中的学习模型。我们的目标是开发一种深度学习模型,能利用注意力机制根据任务从知识图谱中提取相关的先验支撑事实。我们引入了一种基于卷积的模型,用于学习知识图谱实体与关系簇的表示,以缩减注意力空间。我们表明,所提方法对需处理的先验信息量具有高度可扩展性,并可应用于任何通用NLP任务。利用该方法,我们在News20、DBPedia数据集的文本分类以及Stanford Natural Language Inference(SNLI)数据集的自然语言推理上展示了性能的显著提升。我们还证明,当深度学习模型能以知识图谱形式访问有组织的世界知识时,可用大幅更少的标注训练数据训练良好。
引用
@article{arxiv.1802.05930,
title = {Learning beyond datasets: Knowledge Graph Augmented Neural Networks for Natural language Processing},
author = {K M Annervaz and Somnath Basu Roy Chowdhury and Ambedkar Dukkipati},
journal= {arXiv preprint arXiv:1802.05930},
year = {2018}
}
备注
Accepted at NAACL 2018