知识图谱的语义层级细节:通过谱热扩散发现抽象边界
摘要
图结构知识系统——从知识图谱到 GraphRAG 流程——将信息组织为层次化社区,但缺乏对连续分辨率控制的原则机制:抽象层级之间的定性边界应位于何处,如何导航它们?当前方法依赖于离散社区检测,需手动调谐分辨率参数(如 Leiden ),无法实现连续缩放,亦无形式保证。我们引入语义层级细节 (SLoD),通过热核扩散定义连续缩放算子,其 NN 结构由 Poincare 球嵌入诱导。我们在树限(精确树与 Sarkar 嵌入)中证明了层次一致性,给出有界逼近误差,并在噪声层次上演示一致的边界检测行为;图谱拉普拉斯的谱间隙诱导出显现的尺度边界——表征表示发生定性转变的尺度——无需手动分辨率调谐即可检测。在合成层次(HSBM,1024 节点)上,BoundaryScan 检测尺度处的谱聚类可恢复植入层级,宏 ARI 在高 SNR 条件下(50 种随机种子中位数)饱和至 1.00,中等 ARI 在 r=200 时达到 0.89 [0.86, 0.92]。在完整 WordNet 名词层次(82K 同义词)上,使用 100 个分层叶查询,检测到的边界与真实分类深度一致(),表明在无需分辨率参数调谐的情况下,能在真实世界知识图谱中发现有意义的抽象层级。该方法使用的默认参数(包括复合权重、MAD 阈值和 的 NN 参数规则)在 HSBM 与 WordNet 之间无需调整即可转移。
引用
@article{arxiv.2603.08965,
title = {Semantic Level of Detail for Knowledge Graphs: Discovering Abstraction Boundaries via Spectral Heat Diffusion},
author = {Edward Izgorodin},
journal= {arXiv preprint arXiv:2603.08965},
year = {2026}
}
备注
v2: extended companion of GRAAI 2026 workshop paper; full proofs of Lemmas A.1-A.2 (Frechet-mean and heat-kernel Lipschitz constants, corrected) in Appendix A; Proposition 1(i) empirical anchor (new Figure 1); 50-seed ablation with BCa CIs and Wilcoxon tests (Tables 3-4, p<10^-15); WordNet retained (tau=0.79). 21 pages, 6 figures, 4 tables