NeuSym-RAG:面向 PDF 问答的多视图结构化混合神经符号检索
计算与语言
2025-06-03 v2 人工智能
摘要
学术论数量的不断增长给研究人员高效获取关键细节带来了巨大挑战。尽管检索增强生成(RAG)在基于大语言模型(LLM)的自动问答中展现出巨大潜力,但以往的工作往往将神经检索与符号检索割裂开来,忽视了它们之间的互补优势。此外,传统的单视图分块忽略了 PDF 丰富的结构与布局,例如章节和表格。在本工作中,我们提出了 NeuSym-RAG,这是一个在交互过程中结合两种范式的混合神经符号检索框架。通过利用多视图分块和基于模式(schema)的解析,NeuSym-RAG 将半结构化的 PDF 内容同时组织到关系数据库和向量库中,使 LLM 智能体能够迭代地收集上下文,直到足以生成答案。在三个完整的基于 PDF 的问答数据集(包括一个自标注的数据集 AIRQA-REAL)上的实验表明,NeuSym-RAG 稳定地击败了基于向量的 RAG 和各种结构化基线,突显了其统一两种检索方案并利用多视图的能力。代码和数据已公开发布于 https://github.com/X-LANCE/NeuSym-RAG。
引用
@article{arxiv.2505.19754,
title = {NeuSym-RAG: Hybrid Neural Symbolic Retrieval with Multiview Structuring for PDF Question Answering},
author = {Ruisheng Cao and Hanchong Zhang and Tiancheng Huang and Zhangyi Kang and Yuxin Zhang and Liangtai Sun and Hanqi Li and Yuxun Miao and Shuai Fan and Lu Chen and Kai Yu},
journal= {arXiv preprint arXiv:2505.19754},
year = {2025}
}
备注
29 pages, 11 figures, 12 tables, accepted to ACL 2025 Long Main