中文

语言模型敲响知识图谱的丧钟

计算与语言 2023-01-11 v1 人工智能

摘要

医疗健康领域产生大量非结构化和半结构化文本。自然语言处理(NLP)已被广泛用于处处理此类数据。基于深度学习的 NLP,尤其是大型语言模型(LLMs,如 BERT),已获得广泛认可并被大量用于诸多应用。语言模型是词序列上的概率分布。在大规模语料上的自监督学习自动生成基于深度学习的语言模型。BioBERT 和 Med-BERT 是面向医疗健康领域预训练的语言模型。医疗健康使用典型的 NLP 任务,如问答、信息抽取、命名实体识别和搜索,以简化并改进流程。然而,为确保结果的稳健应用,NLP 从业者需要对其进行规范化与标准化。实现规范化与标准化的主要方式之一是使用知识图谱。知识图谱捕获特定领域的概念及其关系,但其构建耗时且需要领域专家的手动介入,这可能十分昂贵。SNOMED CT(医学系统命名法—临床术语)、统一医学语言系统(UMLS)和基因本体(GO)是医疗健康领域流行的本体。SNOMED CT 和 UMLS 捕获疾病、症状和诊断等概念,GO 是世界上最大的基因功能信息来源。医疗健康一直面临着关于各类药物、疾病和手术的信息爆炸。本文主张,使用知识图谱并非解决该领域问题的最佳方案。我们给出了使用医疗健康领域 LLMs 的实验,证明语言模型提供了与知识图谱相同的功能,从而使知识图谱变得冗余。

关键词

引用

@article{arxiv.2301.03980,
  title  = {Language Models sounds the Death Knell of Knowledge Graphs},
  author = {Kunal Suri and Atul Singh and Prakhar Mishra and Swapna Sourav Rout and Rajesh Sabapathy},
  journal= {arXiv preprint arXiv:2301.03980},
  year   = {2023}
}

备注

5 pages