从大规模网络内容中提炼的常识知识
计算与语言
2022-09-16 v2 人工智能
摘要
关于概念及其属性的常识知识(CSK)对人工智能应用很有帮助。先前的工作,如 ConceptNet,已编纂了大型常识知识集合。然而,它们在表达能力上受限于主语-谓语-宾语(SPO)三元组,其中主语为简单概念,谓语和宾语为字符串。本文提出了一种名为 ASCENT++ 的方法,用于自动构建一个大规模常识断言知识库(KB),该知识库具有更强的表达能力,并且比先前的工作具有更好的精确度和召回率。ASCENT++ 超越了 SPO 三元组,通过捕获具有子组和方面的复合概念,以及通过语义方面来精炼断言。后者对于表达断言的时间和空间有效性以及进一步的限定词至关重要。此外,ASCENT++ 将开放信息提取(OpenIE)与通过典型性和显著性评分进行的审慎清理和排序相结合。为了实现高覆盖率,我们的方法利用了包含广泛网络内容的大规模爬取语料库 C4。基于人工判断的评估显示了 ASCENT++ 知识库的卓越质量,而针对问答支持任务的外部评估则突显了 ASCENT++ 的优势。网络界面、数据和代码可在 https://ascentpp.mpi-inf.mpg.de/ 获取。
引用
@article{arxiv.2112.04596,
title = {Refined Commonsense Knowledge from Large-Scale Web Contents},
author = {Tuan-Phong Nguyen and Simon Razniewski and Julien Romero and Gerhard Weikum},
journal= {arXiv preprint arXiv:2112.04596},
year = {2022}
}
备注
This is a substantial extension of the previous WWW paper: arXiv:2011.00905