中文

压缩式知识图谱假说:哪些图谱事实对科学假设生成至关重要?

人工智能 2026-05-29 v2

摘要

知识图谱 (KG) 可以为语言模型提供结构化的科学上下文,但究竟哪些图谱事实实际上塑造了生成的假设,仍不明确。我们研究了针对电池材料的 KG 指导式假设生成问题,测试对象包括 Mistral-7B、Llama-3.1-70B 和 Gemini 2.5 Flash。在模型中,我们通过改变密度、本体丰富度、拓扑结构和控制结构,对局部 KG 进行扰动,并使用提供图谱和固定参考两种指标评估输出。在所有模型中,KG 的效用具有选择性且模型相关:图谱上下文会改变输出,但无 KG 的输出也能从模型先验中恢复大量图谱内容。紧凑的 top-k 子图往往能近似完整 KG 的行为,包括在排除声称结果三元组的情况下。同时,压缩并非仅由一种语义排序规则实现,随机和拓扑基准的子集也能恢复相当大的信号。这些结果支持一种冗余感知的压缩式 KG 假设:有用的 KG 信号往往可从紧凑、具有科学结构的子图中恢复,而无需完整的局部图谱。

关键词

引用

@article{arxiv.2605.27176,
  title  = {The Compressive Knowledge Graph Hypothesis: Which Graph Facts Matter for Scientific Hypothesis Generation?},
  author = {Shashwat Sourav and Viktoriia Baibakova and Sanjay Das and Ran Elgedawy and Maria Mahbub and Emily Herron and Tirthankar Ghosal},
  journal= {arXiv preprint arXiv:2605.27176},
  year   = {2026}
}