中文

面向长文档问答的Grounded Knowledge Graph检索增强生成

辛几何 2026-04-07 v1 高能物理 - 理论 微分几何

摘要

检索增强生成(RAG)系统因其能够提高生成质量的同时缩短所需输入上下文长度而在当今大型语言模型中得到广泛采用。本文聚焦于长文档问答的RAG系统。当前方法严重依赖LLM描述,导致资源消耗和延迟高,层级间内容重复,且因缺乏或有限的对来源文本的 grounding 而产生幻觉。为提高效率和事实准确性,我们提出了GroundedKG-RAG,这是一种从源文档中显式提取并以 grounding 方式构建知识图的RAG系统。具体而言,我们将GroundedKG中的节点定义为实体和动作,将边定义为时间或语义关系,每个节点和边都 grounded 在原始句子中。我们通过语义角色标注(SRL)和抽象意义表示(AMR)解析构建GroundedKG,然后对其进行嵌入以进行检索。在查询时,我们对查询应用相同的转换,并检索出与问题最相关的源文本句子以进行问答。我们在NarrativeQA数据集的实例上对GroundedKG-RAG进行评估,发现其在规模较小的成本下,性能与最新的专有长上下文模型相当,并优于竞争性基线方法。此外,我们的GroundedKG对人类可解释且易于阅读,促进了结果审计和错误分析。

关键词

引用

@article{arxiv.2604.04358,
  title  = {Geometry of the tt*-Toda equations I: universal centralizer and symplectic groupoids},
  author = {Martin A. Guest and Nan-Kuo Ho},
  journal= {arXiv preprint arXiv:2604.04358},
  year   = {2026}
}

备注

28 pages