中文

知识图谱的语义层级细节:通过谱热扩散发现抽象边界

机器学习 2026-05-04 v2 人工智能

摘要

图结构知识系统——从知识图谱到 GraphRAG 流程——将信息组织为层次化社区,但缺乏对连续分辨率控制的原则机制:抽象层级之间的定性边界应位于何处,如何导航它们?当前方法依赖于离散社区检测,需手动调谐分辨率参数(如 Leiden γ\gamma),无法实现连续缩放,亦无形式保证。我们引入语义层级细节 (SLoD),通过热核扩散定义连续缩放算子,其 kkNN 结构由 Poincare 球嵌入诱导。我们在树限(精确树与 Sarkar 嵌入)中证明了层次一致性,给出有界逼近误差,并在噪声层次上演示一致的边界检测行为;图谱拉普拉斯的谱间隙诱导出显现的尺度边界——表征表示发生定性转变的尺度——无需手动分辨率调谐即可检测。在合成层次(HSBM,1024 节点)上,BoundaryScan 检测尺度处的谱聚类可恢复植入层级,宏 ARI 在高 SNR 条件下(50 种随机种子中位数)饱和至 1.00,中等 ARI 在 r=200 时达到 0.89 [0.86, 0.92]。在完整 WordNet 名词层次(82K 同义词)上,使用 100 个分层叶查询,检测到的边界与真实分类深度一致(τ=0.79\tau = 0.79),表明在无需分辨率参数调谐的情况下,能在真实世界知识图谱中发现有意义的抽象层级。该方法使用的默认参数(包括复合权重、MAD 阈值和 k=max(10,min(N,50))k = \max(10, \min(\lfloor\sqrt{N}\rfloor, 50))kkNN 参数规则)在 HSBM 与 WordNet 之间无需调整即可转移。

关键词

引用

@article{arxiv.2603.08965,
  title  = {Semantic Level of Detail for Knowledge Graphs: Discovering Abstraction Boundaries via Spectral Heat Diffusion},
  author = {Edward Izgorodin},
  journal= {arXiv preprint arXiv:2603.08965},
  year   = {2026}
}

备注

v2: extended companion of GRAAI 2026 workshop paper; full proofs of Lemmas A.1-A.2 (Frechet-mean and heat-kernel Lipschitz constants, corrected) in Appendix A; Proposition 1(i) empirical anchor (new Figure 1); 50-seed ablation with BCa CIs and Wilcoxon tests (Tables 3-4, p<10^-15); WordNet retained (tau=0.79). 21 pages, 6 figures, 4 tables