中文

重新思考作为符号知识图谱的语言模型

计算与语言 2023-08-29 v1 人工智能 机器学习

摘要

符号知识图谱(KGs)在搜索、问答和推荐等知识中心应用中起着关键作用。随着在大量文本数据上训练的当代语言模型(LMs)日益突出,研究者广泛探索这些模型的参数化知识是否能与知识图谱中的知识相匹配。多种方法表明,增大模型规模或训练数据量可提升其检索符号知识的能力,且通常只需极少或无需人工监督。尽管有这些进展,在全面评估LMs是否能涵盖KGs复杂的拓扑与语义属性(对推理过程至关重要的属性)方面仍存在空白。本工作中,我们对不同规模与能力的语言模型进行了详尽评估。我们构建了九个定性基准,涵盖对称性、非对称性、层次性、双向性、组合性、路径、实体中心性、偏差和歧义等一系列属性。此外,我们针对每种属性提出了新颖的评估指标。我们对多种LMs的广泛评估表明,尽管这些模型在回忆事实信息方面展现出可观潜力,但其捕捉KGs复杂拓扑与语义特征的能力仍显著受限。我们注意到,相较于现有指标,我们提出的评估指标在评估这些能力时更为可靠。最后,我们的一些基准挑战了“更大的LMs(如GPT-4)普遍优于其更小对手(如BERT)”的普遍看法。

关键词

引用

@article{arxiv.2308.13676,
  title  = {Rethinking Language Models as Symbolic Knowledge Graphs},
  author = {Vishwas Mruthyunjaya and Pouya Pezeshkpour and Estevam Hruschka and Nikita Bhutani},
  journal= {arXiv preprint arXiv:2308.13676},
  year   = {2023}
}