中文

HySemRAG:面向自动文献综述与方法学差距分析的混合语义检索增强生成框架

信息检索 2025-08-11 v1 人工智能 机器学习

摘要

我们提出 HySemRAG,一个结合抽取、转换、加载 (ETL) 流程与检索增强生成 (RAG) 的框架,用于自动化大规模文献综述并识别方法学研究差距。该系统通过多层次方法解决现有 RAG 架构的局限性:混合检索结合语义搜索、关键词过滤和知识图谱遍历;代理人自我纠正框架具备迭代质量保证;事后引用验证确保完整可追溯性。我们的实现包含八个集成阶段:多来源元数据获取、异步 PDF 检索、使用修改 Docling 架构的自定义文档布局分析、图书管理、基于 LLM 的字段提取、主题建模、语义统一和知识图谱构建。该系统创建双重数据产品——Neo4j 知识图谱支持复杂关系查询,Qdrant 向量集合支持语义搜索——为可验证信息综合提供基础设施。评估在 643 项观察、60 次测试会话上显示,结构化字段提取实现 35.1% 更高的语义相似度得分(0.655 ± 0.178),与 PDF 分块方法(0.485 ± 0.204,p < 0.000001)相比。代理人质量保证机制实现 68.3% 单次成功率,99.0% 引用准确率。应用于气象流行病学领域关于臭氧暴露与心血管疾病的文献,系统识别了方法学趋势和研究差距,展示了在跨学科领域加速证据综述和发现的广泛适用性。

关键词

引用

@article{arxiv.2508.05666,
  title  = {HySemRAG: A Hybrid Semantic Retrieval-Augmented Generation Framework for Automated Literature Synthesis and Methodological Gap Analysis},
  author = {Alejandro Godinez},
  journal= {arXiv preprint arXiv:2508.05666},
  year   = {2025}
}

备注

47 pages, 10 figures. Code: https://github.com/agodinezmm2007/docling_mod. Demo: https://youtu.be/ZCy5ESJ1gVE?si=K8CttwgTj7yGrWjn. ETL+multi-agent RAG framework for literature synthesis, 35.1% improvement over PDF chunking. Real application: reduced 17,400 papers to 24 relevant ones (99.86%) in 10 minutes for wastewater epidemiology review