中文

HGNet:面向科学文献自动知识图谱生成的可扩展基础模型

计算与语言 2026-03-25 v1 机器学习

摘要

自动化知识图谱 (KG) 的构建对于导航快速扩张的科学文献体系至关重要。然而,现有方法往往难以识别长期多词实体,通常无法在不同领域之间推广,通常忽视科学知识的层次性。虽然通用大型语言模型 (LLM) 提供了适应性,但计算昂贵且在专业任务上 yield 不一致的准确性。因此,当前的KG浅而不精且不一致,限制了其在探索和综合中的实用性。我们提出了一个可扩展的、零样本的科学KG构建的两阶段框架。第一阶段,Z-NERD引入了 (i) 正交语义分解 (OSD),通过隔离文本中的语义“转折”来促进领域无关的实体识别;以及 (ii) 多尺度TCQK注意力机制,通过n-gram感知注意力头捕获连贯的多词实体。第二阶段,HGNet进行层次感知的关系抽取,显式建模父、子和同级关系。为强制全局一致性,我们引入两种互补目标:一种用于抑制循环和shortcut边的可微分层次损失 (Differentiable Hierarchy Loss),以及一种将抽象层级沿可学习轴嵌入欧几里得空间的连续抽象场 (Continuum Abstraction Field, CAF) 损失。这首次将层次抽象 formalize 为标准欧几里得嵌入中的连续属性,提供了比 hyperbolic 方法更简单的方法。我们发布了SPHERE (https://github.com/basiralab/SPHERE),一个用于层次关系抽取的多领域基准。我们的框架在SciERC、SciER和SPHERE上建立了新的SOTA,使实体识别提高了8.08%,关系抽取提高了5.99%。在零样本设置下,提升幅度分别达到10.76%和26.2%。

关键词

引用

@article{arxiv.2603.23136,
  title  = {HGNet: Scalable Foundation Model for Automated Knowledge Graph Generation from Scientific Literature},
  author = {Devvrat Joshi and Islem Rekik},
  journal= {arXiv preprint arXiv:2603.23136},
  year   = {2026}
}