GraphMERT:从非结构数据提取可靠知识图的高效可扩展蒸馏
摘要
研究人员已追求近三十年来神经符号人工智能 (AI) 应用。神经和符号组件的结合可以导致AI的快速进步。然而,该领域自从大多数神经符号AI框架无法实现规模化后,从未实现这一承诺。此外,纯神经方法的隐式表示和近似推理限制了可解释性和可信度。知识图 (KG),作为显式语义知识的金标准表示,可以解决符号问题。然而,从文本语料库中自动推导可靠的KG仍是开放问题。我们通过引入GraphMERT,一个微型图形编码器-only模型,从非结构文本语料库及其自身内部表示中提取高质量KG来解决这些挑战。GraphMERT及其等效KG形成模块化的神经符号堆栈:神经抽象学习;符号KG用于可验证推理。GraphMERT+KG是首个实现了基准准确率优于基线且符号表示更优的高效可扩展神经符号模型。具体而言,我们针对可靠的领域特定KG,确保其既(1)事实正确(具有来源),且(2)有效(本体一致的关系具有领域适当的语义)。当大型语言模型 (LLM),如Qwen3-32B,生成领域特定KG时,由于提示敏感性、浅层领域专业知识和幻觉关系,在可靠性方面不足。在来自糖尿病PubMed论文的文本上,我们8000万参数的GraphMERT获得69.8%的FActScore;320亿参数的基线LLM仅获得40.2%的FActScore。GraphMERT KG还获得了68.8%的ValidityScore,而LLM基线为43.0%。
引用
@article{arxiv.2510.09580,
title = {GraphMERT: Efficient and Scalable Distillation of Reliable Knowledge Graphs from Unstructured Data},
author = {Margarita Belova and Jiaxin Xiao and Shikhar Tuli and Niraj K. Jha},
journal= {arXiv preprint arXiv:2510.09580},
year = {2026}
}
备注
Camera-ready version. Published in Transactions on Machine Learning Research (TMLR), 2026. Reviewed on OpenReview: https://openreview.net/forum?id=tnXSdDhvqc