中文

面向多实体问答的结构化检索增强生成:基于 Wikipedia 图

计算与语言 2025-03-07 v2 信息检索

摘要

多实体问答(MEQA)为大语言模型(LLM)带来了重大挑战,由于它们往往难以整合来自多个文档中零散的信息。例如,一个问题可能是“IEEE Fellow 在各学习领域中的分布情况如何?”,这需要检索来自不同来源(如 Wikipedia 页面)的信息。当前检索增强生成(RAG)方法的有效性受到 LLM 整合来自众多页面洞察的能力限制。为此,本文引入了结构化 RAG(SRAG)框架,系统性地将提取的实体组织成关系表格(例如,对实体进行模式列如“名称”和“领域”),然后应用基于表格的推理技术。我们的做法将检索与推理解耦,使 LLM 能够专注于结构化数据分析而非原始文本聚合。在基于 Wikipedia 的多实体 QA 任务上的大量实验表明,SRAG 在准确率上显著优于最先进的长上下文 LLM 和 RAG 解决方案,实现了 29.6% 的准确率提升。结果强调了结构化非结构化数据以增强 LLM 推理能力的有效性。

关键词

引用

@article{arxiv.2503.01346,
  title  = {SRAG: Structured Retrieval-Augmented Generation for Multi-Entity Question Answering over Wikipedia Graph},
  author = {Teng Lin and Yizhang Zhu and Yuyu Luo and Nan Tang},
  journal= {arXiv preprint arXiv:2503.01346},
  year   = {2025}
}